Injection dans le prompt
Dernière étape : transformer les passages retrouvés en une réponse. Le secret n'a rien de magique — c'est la façon dont on rédige le message envoyé au modèle.
Le prompt : le message que le modèle lit vraiment
Quand vous parlez à un assistant IA, tout ce qu'il « voit » tient dans un unique bloc de texte qu'on appelle le prompt. Le RAG exploite cette propriété : plutôt que d'envoyer la question seule, on fabrique un prompt augmenté qui contient trois ingrédients, dans cet ordre :
- des instructions : le rôle du modèle et ses règles du jeu ;
- le contexte : les K passages retrouvés au chapitre 4, avec leurs sources ;
- la question de l'utilisateur, telle quelle.
C'est un brief remis à un expert : « Voici ta mission (instructions), voici le dossier avec les trois documents utiles (contexte), voici la question du client (question). Réponds uniquement à partir du dossier. » L'expert n'a pas besoin de tout savoir — il a besoin d'un bon dossier.
Les instructions : la partie qui évite les hallucinations
Le bloc d'instructions (le « System » dans le schéma) fait tout le travail de cadrage. Trois consignes y sont presque toujours présentes, et chacune répond à un risque précis :
- « Réponds uniquement à partir du contexte fourni. » Sans elle, le modèle mélange volontiers les extraits avec ses connaissances générales — potentiellement obsolètes ou fausses pour votre entreprise.
- « Si l'information n'y figure pas, dis-le. » C'est la permission explicite de ne pas répondre — le meilleur antidote connu aux hallucinations. Un « je ne trouve pas cette information dans la documentation » vaut infiniment mieux qu'une invention plausible.
- « Cite tes sources. » Grâce aux métadonnées conservées depuis le chapitre 1, la réponse peut pointer vers le document et la page d'origine — et l'utilisateur peut vérifier par lui-même.
Ce que ça change, concrètement
Comparons les deux mondes sur la même question, « Puis-je bosser de chez moi le vendredi ? » :
« La plupart des entreprises autorisent 2 à 3 jours de télétravail par semaine. Renseignez-vous auprès de votre service RH… »
Générique, invérifiable, possiblement faux pour votre entreprise.
« Oui, le vendredi est possible : le télétravail est limité à 2 jours par semaine après 3 mois d'ancienneté, et seuls les mardis sont obligatoirement en présentiel (règlement intérieur, p. 12-13). »
Précis, propre à votre règlement, sourcé et vérifiable.
Et si le contexte ne suffit pas ?
C'est le scénario à concevoir dès le départ. Si le retrieval n'a rien trouvé de vraiment pertinent (scores faibles) ou si la question sort du périmètre des documents, un système bien conçu ne force pas une réponse : il l'assume — « je n'ai pas trouvé cette information » — et peut proposer un relais (contacter les RH, reformuler la question). Les échecs silencieux, où le modèle brode à partir d'extraits hors sujet, sont précisément ce que les trois consignes du bloc d'instructions servent à empêcher.
À retenir : le RAG ne rend pas le modèle plus intelligent — il lui donne un meilleur dossier et des règles claires. La qualité finale se joue à chaque maillon : des documents propres (ch. 1), bien découpés (ch. 2), bien cartographiés (ch. 3), bien retrouvés (ch. 4) et bien présentés (ch. 5).
Et maintenant ?
Vous avez le pipeline complet en tête. Pour ancrer tout ça :
- Le playground RAG interactif — rejouez visuellement chaque étape de ce guide : tapez une question, regardez-la devenir un vecteur, capturer ses voisins et remplir le prompt final.
- Dense vs. Sparse Retrieval — l'article technique pour aller un cran plus loin (similarité cosinus, BM25, recherche hybride, bases vectorielles).
- Le protocole MCP — comment les agents IA se connectent à des outils externes, au-delà de la seule recherche documentaire.