Découpage (chunking)
Découper les documents en passages plus courts avant de les embedder pour du RAG. La taille des chunks arbitre entre précision de récupération et complétude du contexte, et affecte directement le nombre de vecteurs et le coût.
Ce que c'est
Chaque chunk devient un vecteur dans la base vectorielle. Les petits chunks (100-200 tokens) donnent des correspondances nettes mais peuvent perdre le contexte autour ; les grands (500-1 000) portent plus de contexte mais diluent la pertinence et coûtent plus à envoyer au LLM.
Pourquoi c'est important
Diviser par deux la taille des chunks double ~le nombre de vecteurs et le coût d'embedding, et change combien de chunks il faut récupérer pour couvrir une réponse. C'est un réglage directement relié à la facture.