Chapitre 4 · Phase d'interrogation

Retrieval : retrouver les bons passages

La bibliothèque est prête. Quelqu'un pose enfin une question — et tout ce chapitre tient dans la fraction de seconde qui suit.

Accessible à tous 7 min de lecture

La question suit le même chemin que les documents

Un employé tape : « Puis-je bosser de chez moi le vendredi ? ». Première opération : sa question passe dans le même modèle d'embedding que les chunks au chapitre 3. Elle devient à son tour un vecteur — un point sur la même carte du sens.

C'est le point crucial de tout le système : comme la question et les documents sont projetés sur la même carte, « trouver les passages pertinents » devient un simple problème de géométrie : quels points de la bibliothèque sont les plus proches du point de la question ?

Pour se représenter les choses

Vous cherchez un restaurant : l'application place votre position sur la carte, puis affiche les restaurants dans un rayon proche. Le retrieval fait exactement cela — sauf que la carte est celle du sens, votre position est la question, et les restaurants sont les chunks.

Mesurer la « proximité » entre deux textes

Pour classer les chunks du plus proche au plus lointain, il faut une règle de mesure. La plus utilisée s'appelle la similarité cosinus. Derrière ce nom intimidant, une idée simple : on regarde si les deux vecteurs « pointent dans la même direction » sur la carte du sens. Le résultat est un score entre −1 et 1 :

  • proche de 1 : les deux textes parlent de la même chose ;
  • proche de 0 : aucun rapport entre eux ;
  • négatif : des sens opposés (rare en pratique).

« Puis-je bosser de chez moi ? » et notre chunk_047 sur le télétravail obtiennent par exemple 0,89. Le chunk sur le barème kilométrique : 0,31. Le classement est fait — sans qu'aucun mot n'ait eu besoin d'être identique.

Congés Notes de frais Outils rayon des K=3 plus proches 0.89 0.84 0.78 0.61 — non retenu Votre question
La question (point cyan) est projetée sur la carte. Les K=3 chunks les plus proches (violets, avec leur score de similarité) sont retenus ; les autres restent en dehors du rayon.

Le top-K : combien de passages garder ?

On ne garde pas un passage, mais les K meilleurs — souvent entre 3 et 10. Pourquoi plusieurs ? Parce que la réponse complète est parfois répartie : la règle générale du télétravail dans un chunk, l'exception du mardi dans un autre. Et pourquoi pas cinquante ? Parce qu'au-delà de quelques passages, on ajoute du bruit : des extraits moyennement pertinents qui diluent les bons et allongent le message envoyé à l'IA.

K est l'un des réglages les plus simples et les plus efficaces d'un système RAG : on l'ajuste en testant de vraies questions et en regardant si l'information nécessaire figure bien dans les passages retenus.

Quand le retrieval se trompe

Le retrieval est la pièce la plus fragile du pipeline : si les bons passages ne sont pas retrouvés ici, rien en aval ne pourra les rattraper — l'IA ne peut pas s'appuyer sur un texte qu'on ne lui a pas donné. Les causes d'échec classiques :

  • La question est trop vague. « Ça marche comment ici ? » ne pointe vers aucun quartier précis de la carte.
  • L'information n'existe pas dans les documents. Le retrieval renverra quand même K passages — les « moins mauvais » — d'où l'importance de scores minimum et d'un modèle autorisé à dire « je ne sais pas » (chapitre 5).
  • Le vocabulaire très spécifique (références, codes produit, noms propres) est mieux servi par la recherche par mots-clés classique. Les systèmes matures combinent d'ailleurs les deux : c'est la recherche hybride, détaillée dans l'article Dense vs. Sparse Retrieval.

À essayer : le playground interactif anime précisément cette étape — vous tapez une question, vous voyez son point apparaître sur la carte et le cercle de recherche capturer ses K plus proches voisins.