Indexa documentos de referencia para uso no RAG. Extrai texto de PDFs, processa e adiciona ao corpus. Use quando: adicionar documento, buscar referencia, listar docs.
Esta skill gerencia documentos de referencia externa, indexando-os para uso no RAG.
Adiciona documento ao indice de referencias:
/ref-add .project/references/legal/lei-13775-2018.pdf
Acoes:
Busca nos documentos de referencia:
/ref-search "prazo de aceite duplicata"
Retorna:
Lista todos os documentos indexados:
/ref-list
Mostra:
Remove documento do indice:
/ref-remove .project/references/legal/documento-antigo.pdf
| Formato | Extensao | Metodo de Extracao |
|---|---|---|
| pdftotext / PyPDF2 | ||
| Word | .docx | python-docx |
| Markdown | .md | Direto |
| Texto | .txt | Direto |
| HTML | .html | BeautifulSoup |
.project/references/
βββ legal/ # Leis, regulamentos, normas
βββ technical/ # RFCs, especificacoes tecnicas
βββ business/ # Regras de negocio, manuais
βββ internal/ # Documentos internos
βββ _index.yml # Indice de documentos
Arquivo _index.yml:
index:
version: 1
updated_at: "2026-01-12T..."
documents:
- id: "ref-001"
path: "legal/lei-13775-2018.pdf"
title: "Lei 13.775/2018 - Duplicatas EletrΓ΄nicas"
category: legal
added_at: "2026-01-12T..."
indexed: true
summary: "Lei que regulamenta as duplicatas escriturais..."
keywords:
- duplicata
- escritural
- eletronica
page_count: 5
- id: "ref-002"
path: "technical/icp-brasil.pdf"
title: "PadrΓ΅es ICP-Brasil"
category: technical
added_at: "2026-01-12T..."
indexed: true
# Usando pdftotext (poppler-utils)
pdftotext -layout input.pdf output.txt
# Usando Python
python3 << 'EOF'
import PyPDF2
with open('input.pdf', 'rb') as f:
reader = PyPDF2.PdfReader(f)
text = ''
for page in reader.pages:
text += page.extract_text() + '\n'
print(text)
EOF
from docx import Document
doc = Document('input.docx')
text = '\n'.join([p.text for p in doc.paragraphs])
print(text)
Documentos indexados sao adicionados ao corpus RAG:
corpus_entry:
id: "ref-001"
source: "references/legal/lei-13775-2018.pdf"
type: "reference"
category: "legal"
content: "{texto extraido}"
embeddings: [...] # Gerado pelo RAG
metadata:
title: "Lei 13.775/2018"
page: 1
section: "Art. 1"
indexing_workflow:
1_validate:
- Verificar formato suportado
- Verificar tamanho (max 50MB)
- Verificar permissoes
2_extract:
- Extrair texto do documento
- Limpar formatacao
- Dividir em chunks
3_analyze:
- Gerar resumo automatico
- Extrair keywords
- Classificar categoria
4_index:
- Adicionar ao corpus RAG
- Gerar embeddings
- Atualizar indice
5_verify:
- Testar busca
- Verificar qualidade
No settings.json:
{
"memory": {
"rag_corpus": ".project/corpus",
"max_document_size_mb": 50,
"chunk_size": 1000,
"chunk_overlap": 200
}
}
lei-13775-2018-duplicatas.pdfAlguns PDFs sao imagens escaneadas. Use OCR:
ocrmypdf input.pdf output.pdf
pdftotext output.pdf -
Divida em partes menores ou aumente max_document_size_mb.
Force UTF-8 na extracao:
pdftotext -enc UTF-8 input.pdf output.txt