Tecnologia & IA

O que é RAG (Retrieval-Augmented Generation)?

RAG é a técnica de buscar informações relevantes (de um banco, doc, web) antes de gerar a resposta com LLM — combina busca + geração.

O LLM sozinho sabe só do que viu no treino (cutoff de data, sem dados privados). RAG resolve: pega a pergunta, busca docs relevantes (via embeddings + vector DB), e injeta no prompt como contexto.

É como SaaS de chatbot pra documentação funciona: busca em embeddings da doc, monta prompt com trechos achados, LLM responde citando. Mais barato que treinar modelo próprio.

Perguntas frequentes

RAG substitui fine-tuning?
Em quase todos casos. Fine-tuning é caro, exige dataset; RAG só precisa dos docs e funciona out-of-the-box.
Por que RAG e não passar tudo no contexto?
Mais barato (envia só o relevante), mais rápido, e evita "lost in the middle" em contextos enormes.