RAG é um sistema de recuperação
O modelo de linguagem é apenas a etapa mais visível. A qualidade começa na ingestão: documentos bem segmentados, metadados úteis, política de atualização e uma estratégia de busca alinhada às perguntas reais dos usuários.
Chunking é uma decisão semântica
Dividir todo documento pelo mesmo número de caracteres é simples, mas ignora sua estrutura. Bons chunks preservam unidades de sentido — uma regra, um procedimento, uma seção — e carregam contexto suficiente para serem compreendidos fora do documento original.
Contexto maior não significa resposta melhor
Enviar muitos trechos aumenta custo e pode diluir a evidência relevante. Busca híbrida, re-ranking e filtros por metadados ajudam a produzir um conjunto pequeno e coerente de fontes antes que o modelo gere qualquer texto.
Avaliar é parte da arquitetura
Um sistema confiável mede recuperação e geração separadamente. Conjuntos de perguntas representativas, rastreabilidade das fontes, taxa de abstenção e revisão de falhas criam o ciclo necessário para evoluir com evidência, não com impressão.
Se esta ideia te ajudou, compartilhe com alguém que também constrói sistemas.