Qu'est-ce que le RAG ? L'IA ancrée sur des sources, expliquée

TL;DR

Le RAG — génération augmentée par récupération — signifie que l'IA cherche quelque chose avant de répondre. Au lieu de puiser dans son entraînement, le système fouille vos documents, place les passages les plus pertinents devant le modèle et lui demande de répondre à partir de ceux-ci, avec des citations vers la source. Cela corrige la date limite d'entraînement, le problème du « il n'a jamais vu mes fichiers » et une grande part de l'invention assurée. Pas la totalité.

Le problème, énoncé correctement

Un modèle de langage est, en pratique, une très bonne compression d'une grande quantité de texte lu une fois. Cela lui donne fluidité et étendue, et trois faiblesses précises : ses connaissances s'arrêtent à sa date limite d'entraînement, il n'a jamais rien vu de privé, et quand il ignore quelque chose il produit tout de même une réponse plausible, parce que produire du texte plausible est tout son métier.

On ne peut pas réentraîner un modèle chaque fois qu'on écrit un document. Alors on change plutôt l'origine de la réponse.

Les quatre étapes

  1. Indexer. Vos documents sont découpés en passages — quelques paragraphes chacun — et chaque passage est converti en une représentation numérique qui capture son sens. Cela se fait une fois, au départ.
  2. Récupérer. Votre question est convertie de la même façon, et le système trouve les passages les plus proches par le sens. Ce n'est pas de la correspondance de mots-clés : « qu'avions-nous convenu sur les retards de livraison » peut trouver un paragraphe qui dit « décalages d'expédition » sans jamais employer vos mots.
  3. Augmenter. Ces passages sont placés dans le contexte du modèle avec votre question et une instruction de répondre à partir du matériel fourni.
  4. Générer et citer. Le modèle écrit la réponse, et comme le système sait quels passages lui ont été donnés, il peut renvoyer chaque affirmation à sa source.

C'est tout. La partie astucieuse est l'étape 2 ; la partie digne de confiance est l'étape 4.

Neurobase affichant une réponse ancrée sur des sources, avec des citations renvoyant au matériel d'origine.
La citation est la fonctionnalité. Une réponse invérifiable n'est qu'un avis assuré.

Pourquoi « colle-le simplement dans le chat » n'est pas la même chose

Joindre un document à une conversation place l'ensemble dans le contexte du modèle pour cette conversation. Cela fonctionne très bien pour un article. Cela cesse de fonctionner quand il y en a quatre-vingt-dix, quand vous poserez encore des questions le mois prochain, ou quand le paragraphe pertinent est à la page 340 et que les 339 pages alentour sont du bruit qui rivalise pour l'attention du modèle.

Le RAG indexe une fois et récupère par question. Vous payez le coût d'installation une seule fois, puis interrogez toute la collection indéfiniment. Nous avons développé ce compromis dans GPT-5 face à Gemini — les modèles à grand contexte ont réduit l'écart pour un document isolé, mais pas pour les collections auxquelles on revient.

Là où le RAG échoue encore

Il vaut la peine d'être précis, parce que « ancré » est employé comme s'il voulait dire « correct » :

Le mécanisme général derrière le deuxième point mérite d'être compris en soi — voir pourquoi l'IA invente.

Quand l'installation en vaut la peine

SituationÀ utiliser
Un document, une questionCollez-le dans un chat
Un long document que vous interrogerez souventL'un ou l'autre, penchant RAG
Des dizaines de documents sur un sujetRAG
Des réponses sur lesquelles quelqu'un d'autre s'appuieraRAG — pour les citations, pas pour la récupération
Média mixtes : PDF, vidéo, audio, pages webRAG, s'il les gère tous
Questions de culture généraleNi l'un ni l'autre — demandez à un modèle

À quoi cela ressemble en tant que produit

Neurobase est notre version : vous donnez des sources à un Neurone — PDF, fichiers texte, vidéo, YouTube, pages web, images, audio — et il les indexe en un assistant focalisé qui répond avec des citations vers le matériel d'origine. Les réponses peuvent être testées dans le Lab avant que vous ne vous y fiiez, et plusieurs Neurones peuvent s'enchaîner en un flux avec des opérations comme Résumer, Comparer, Extraire et Traduire.

Si vous voulez la version concrète plutôt que le concept, commencez par transformer un dossier de PDF en assistant.

Questions fréquentes

Qu'est-ce que le RAG ?

Génération augmentée par récupération : le système cherche d'abord dans vos documents, place les passages pertinents dans le contexte du modèle et lui demande de répondre à partir de ceux-ci — avec citations.

Quel problème résout-il ?

Les dates limites d'entraînement, les documents privés jamais vus, et l'invention assurée. Les citations permettent de vérifier plutôt que de croire.

Est-ce comme téléverser un fichier ?

Non. Joindre un fichier vaut pour un document dans une conversation. Le RAG indexe une collection une fois et récupère par question, sur de nombreuses conversations.

Empêche-t-il l'IA d'inventer ?

Il réduit fortement, sans éliminer. La récupération peut rater, les réponses dériver, les sources être fausses. Les citations rendent ces échecs vérifiables.