Tecnologia & IA
O que é Embedding (Vetor Semântico)?
Embedding é a representação numérica (vetor de 768-3072 dimensões) que captura o significado de um trecho de texto — base de busca semântica e RAG.
Modelos como text-embedding-3 (OpenAI), text-embedding-004 (Google) e Cohere transformam frases em vetores. Textos com significado parecido ficam próximos no espaço vetorial — cosine similarity mede a proximidade.
Custo é baixíssimo (centavos por milhão de tokens) e a base é estática (gera uma vez, guarda em vector DB). É o que permite "busca por significado" em vez de match exato de palavra.
Perguntas frequentes
Embedding e LLM são o mesmo modelo?
Não. Embedding model transforma texto em vetor; LLM gera texto. Pipelines RAG usam os dois juntos.
Como saber se 2 textos são "semanticamente parecidos"?
Calcula cosine similarity entre os vetores. > 0,8 = muito parecido; 0,5-0,8 = relacionado; < 0,3 = diferente.