Le RAG (Retrieval-Augmented Generation, génération augmentée par récupération) est une technique qui associe un moteur de recherche documentaire à un modèle de langage. Avant de répondre, le système récupère des passages pertinents dans une base externe, puis les transmet au modèle, qui rédige sa réponse à partir d’eux. Le sigle RAG a été introduit par un article de Patrick Lewis et de onze coauteurs, accepté à la conférence NeurIPS 2020.
Comment ça fonctionne
Le RAG repose sur deux mémoires, selon l’article de Lewis et al. (arXiv:2005.11401). La mémoire paramétrique est le savoir stocké dans les poids du modèle. La mémoire non paramétrique est un index documentaire consultable, que l’on met à jour sans réentraîner le modèle.
- Découpage : les documents sont divisés en passages. Les auteurs découpent un export de Wikipedia de décembre 2018 en 21 millions de passages de 100 mots.
- Vectorisation : chaque passage est converti en embedding, un vecteur numérique qui représente son sens. Les auteurs utilisent le Dense Passage Retriever (DPR) de Karpukhin et al., un double encodeur fondé sur BERT (arXiv:2004.04906).
- Indexation : les vecteurs sont rangés dans un index de recherche rapide ; l’article emploie la bibliothèque FAISS.
- Récupération : la question est vectorisée à son tour, et le système retient les passages dont les vecteurs sont les plus proches.
- Génération : le modèle BART-large, 400 millions de paramètres selon l’article, rédige la réponse en tenant compte des passages retenus.
Le RAG ne garantit pas l’exactitude d’une réponse. La qualité du résultat dépend des passages récupérés : une source fausse ou périmée produit une réponse fausse. Une veille sérieuse remonte donc toujours au document cité.
Exemple
L’article fondateur de 2020 évalue le RAG sur des tâches de questions-réponses en domaine ouvert. Selon Lewis et al., les modèles RAG établissent l’état de l’art sur trois de ces tâches. Face à un modèle sans récupération, ils produisent selon les auteurs un langage « more specific, diverse and factual ». Les auteurs appartiennent à Facebook AI Research, à University College London et à New York University.
Les moteurs génératifs appliquent un principe voisin aux résultats d’un moteur de recherche. Google indique que ses AI Overviews et son mode IA peuvent lancer plusieurs recherches apparentées, technique appelée « query fan-out », pour construire une réponse (Google Search Central). Être récupéré puis cité par ces systèmes est l’objet de la Generative Engine Optimization.
À ne pas confondre avec
- LLM : le grand modèle de langage est le générateur ; le RAG est l’architecture qui l’alimente en documents.
- Fine-tuning : réentraînement qui modifie les poids du modèle. Le RAG laisse les poids intacts et change seulement les documents fournis au modèle.
- Moteur de recherche : un moteur classique renvoie une liste de liens ; un système RAG rédige une réponse à partir des passages trouvés.
Questions fréquentes
C'est quoi le RAG en IA ?
Le RAG (Retrieval-Augmented Generation) est une technique qui fait chercher des passages dans une base documentaire avant de faire rédiger la réponse par un modèle de langage. La réponse s'appuie ainsi sur des documents consultables.
Quelle est la différence entre RAG et fine-tuning ?
Le fine-tuning modifie les poids du modèle par un nouvel entraînement. Le RAG laisse le modèle inchangé et lui fournit, à chaque question, des documents récupérés dans un index que l'on met à jour à part.
Le RAG supprime-t-il les hallucinations ?
Non. Selon Lewis et al. (2020), le RAG produit un langage plus factuel qu'un modèle de référence sans récupération, mais la réponse dépend toujours de la qualité des passages retrouvés.
SOURCES
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al.), résumé et version HTML, arXiv, accepté à NeurIPS 2020, v1 22/05/2020, v4 12/04/2021
- Dense Passage Retrieval for Open-Domain Question Answering (Karpukhin et al.), arXiv, EMNLP 2020, v1 10/04/2020, révisé 30/09/2020
- AI features and your website, Google Search Central, mis à jour le 10/12/2025