Embedding
Uma lista de números (um vetor) que representa o significado de um trecho de texto, de modo que significados parecidos fiquem próximos. A peça básica da busca semântica e do RAG.
O que é
Um modelo de embeddings transforma texto num vetor de comprimento fixo — normalmente de 384 a 3.072 números. Textos com significado relacionado produzem vetores próximos entre si por uma medida de distância, geralmente a similaridade de cosseno.
As APIs de embeddings são cobradas por token de entrada, como um LLM, mas bem mais baratas — muitas vezes 0,02-0,15 $ por 1M.
Por que importa
Os embeddings são o que permite buscar numa base de conhecimento por significado em vez de por palavras-chave. O custo tem duas partes: uma passada de embeddings única (ou na atualização) sobre os seus documentos, e o embedding contínuo de cada consulta.
Impacto em custo e infraestrutura
Fazer embeddings de um corpus de 10M de tokens uma vez a 0,10 $/1M custa 1 $. O custo recorrente é dominado pelo banco de dados vetorial que armazena e busca os resultados, não pelas chamadas de embeddings.