Le RAG en 2026 : le contexte long n'a pas tué la recherche, il a relevé la barre
Les modèles lisent désormais un million de tokens, et GraphRAG, la recherche agentique et les embeddings multimodaux ont mûri. Pourtant, la recherche sur le contexte long, le coût et la latence gardent la récupération au cœur de tout assistant documentaire sérieux. Voici le pipeline que nous recommandons, ce qu'il faut tester en espagnol et en français, et ce qu'il coûte.
Les fenêtres d'un million de tokens sont désormais la norme sur plusieurs modèles de pointe, mais la recherche reste la colonne vertébrale de tout assistant documentaire sérieux. Les travaux sur le contexte long (Lost in the Middle, RULER, NoLiMa, le context rot de Chroma) montrent que la précision baisse quand l'entrée grandit, et chaque requête sur un corpus entier paie tous ses tokens.
Le pipeline qui fonctionne en 2026 : un parsing soigné, des chunks contextualisés, une recherche hybride, un reranker, des citations et des filtres d'accès, plus une recherche agentique pour les questions en plusieurs étapes. Sous environ 200 000 tokens de contenu stable, le conseil d'Anthropic tient : passez-vous de recherche et mettez toute la base en cache.
Une fenêtre d'un million de tokens rend-elle le RAG obsolète ?
Non, mais elle déplace le seuil. Depuis Claude 4.6, une requête de 900 000 tokens coûte autant par token qu'une requête de 9 000, et GPT-5.4 comme DeepSeek V4 offrent aussi un million de tokens ; depuis GPT-5.5, OpenAI facture le double en entrée et 1,5 fois en sortie au-delà de 272 000 tokens. La capacité n'est plus la limite. Le coût, la latence et la précision, si.
La précision est le point le moins intuitif. Lost in the Middle (2023) a montré que les modèles exploitent mieux l'information placée au début et à la fin du contexte qu'au milieu. Dans RULER (2024), seule la moitié de 17 modèles annonçant 32K tokens ou plus tenait à 32K. NoLiMa (2025) a supprimé les correspondances littérales entre question et réponse : 11 modèles sur 13 sont tombés sous la moitié de leur score en contexte court à 32K. L'étude de Chroma sur le context rot (2025, 18 modèles) a observé une dégradation même sur des tâches simples.
Les modèles récents font mieux (OpenAI annonce 96,3 % pour GPT-6 Astra sur son test à 8 aiguilles entre 512K et 1M de tokens), mais retrouver des aiguilles n'est pas raisonner sur un corpus désordonné, et chaque requête paie toujours toute la fenêtre.
Le seuil d'Anthropic : sous environ 200 000 tokens (quelque 500 pages) de contenu qui change peu, mettez tout dans le prompt avec le cache. Au-delà, ou avec des droits d'accès, des mises à jour fréquentes ou des citations obligatoires, construisez une recherche.
Le pipeline de 2026, étape par étape
- Parsez avant d'indexer. Beaucoup d'échecs commencent ici : PDF sur deux colonnes, tableaux aplatis, pages scannées. Conservez titres, lignes de tableau et numéros de page ; envoyez les scans vers l'OCR ou vers une recherche par image de page.
- Découpez selon la structure. Coupez par sections et paragraphes, gardez les tableaux entiers et stockez les métadonnées sur lesquelles vous filtrerez : source, date, langue, responsable, groupes d'accès.
- Ajoutez du contexte à chaque chunk. Le Contextual Retrieval d'Anthropic ajoute en tête 50 à 100 tokens qui situent le fragment dans son document, avant l'embedding et l'indexation BM25 ; avec le cache de prompt, Anthropic estimait le coût unique à 1,02 $ par million de tokens de documents.
- Cherchez en hybride. BM25 attrape les termes exacts (codes produit, numéros d'article, noms), les vecteurs attrapent la paraphrase. BEIR a montré que BM25 est une base robuste sans entraînement spécifique, alors que les modèles denses généralisent souvent mal hors de leur domaine.
- Reclassez. Récupérez un large ensemble de candidats (nous partons de 50 à 100), passez-le dans un reranker et transmettez au modèle les 5 à 20 meilleurs passages.
- Citez. Renvoyez les identifiants des passages avec la réponse et vérifiez automatiquement que chaque citation existe dans le texte récupéré.
Les étapes s'additionnent. Dans les tests d'Anthropic, les échecs de récupération dans le top 20 sont passés de 5,7 % à 3,7 % avec des embeddings contextuels, à 2,9 % en ajoutant un BM25 contextuel et à 1,9 % avec un reranker : 67 % de moins au total.
Embeddings et rerankers disponibles en 2026
| Modèle | Type et accès | Prix | Ce qui le distingue |
|---|---|---|---|
| text-embedding-3-large (OpenAI) | Embedding, API | 0,13 $ | Jusqu'à 3 072 dimensions ; 54,9 % sur MIRACL multilingue (ada-002 : 31,4 %) |
| gemini-embedding-2 (Google) | Embedding multimodal, API | 0,20 $ texte, 0,45 $ images | Texte, images, vidéo, audio et PDF dans un même espace |
| voyage-3.5 et 3.5-lite (Voyage AI) | Embedding, API | 0,06 $ et 0,02 $ | Voyage 4 ajoute un espace commun entre tailles et un modèle nano ouvert |
| Qwen3-Embedding-8B (Alibaba) | Embedding, ouvert (Apache 2.0) | Auto-hébergé | N° 1 de MTEB multilingue au 5 juin 2025 ; contexte de 32K |
| EmbeddingGemma (Google) | Embedding, ouvert | Auto-hébergé | 308M paramètres, moins de 200 Mo quantifié, plus de 100 langues |
| Rerank 4 et 3.5 (Cohere) | Reranker, API | Voir l'éditeur | Multilingue ; Rerank 4 (décembre 2025) est le plus précis de Cohere |
| rerank-2.5 (Voyage AI) | Reranker, API | 0,05 $ | Contexte de 32K tokens, suit des instructions |
| Qwen3-Reranker 0.6B à 8B (Alibaba) | Reranker, ouvert (Apache 2.0) | Auto-hébergé | Contexte de 32K, plus de 100 langues |
Voyage affirme qu'un LLM généraliste utilisé comme reranker coûte 25 à 60 fois plus que rerank-2.5 et est 9 à 48 fois plus lent (une affirmation d'éditeur). Changer de modèle d'embeddings impose de réindexer le corpus : pour l'espagnol et le français, présélectionnez des modèles multilingues et tranchez sur le recall@k mesuré sur vos propres documents.
Scans, présentations et graphes : au-delà des chunks de texte
Documents visuels. ColPali (2024, ICLR 2025) encode des images de pages avec un modèle vision-langage et les compare par interaction tardive ; sur le benchmark ViDoRe, il a battu les pipelines fondés sur l'OCR tout en étant plus simple et plus rapide à indexer. gemini-embedding-2 et voyage-multimodal-3.5 placent aussi images et vidéo dans le même espace que le texte. Utilisez-les pour les présentations, formulaires, graphiques et scans.
GraphRAG. GraphRAG de Microsoft (2024) construit un graphe d'entités et des résumés par communauté à l'indexation, et a battu le RAG classique en exhaustivité et en diversité sur des questions globales portant sur des corpus d'environ un million de tokens, au prix d'une indexation coûteuse. LazyGraphRAG a ramené l'indexation au coût du RAG vectoriel (0,1 % du GraphRAG complet) et, pour 4 % de son coût de requête globale, a dépassé les méthodes comparées par Microsoft.
Notre règle : GraphRAG est rentable pour les questions sur l'ensemble du corpus (thèmes récurrents dans 5 000 contrats, liens entre fournisseurs), pas pour les recherches ponctuelles.
Recherche agentique : le modèle lance les requêtes
Dans la recherche agentique, le modèle décide quoi chercher, lit les résultats, reformule et relance, en combinant mots-clés, vecteurs, SQL, API et listes de fichiers. Elle convient aux questions en plusieurs étapes et aux sources structurées.
Cursor indique qu'ajouter une recherche sémantique au grep de son agent a amélioré la précision des réponses de 12,5 % en moyenne (de 6,5 % à 23,5 % selon le modèle) sur des bases de code de plus de 1 000 fichiers, les meilleurs résultats venant de la combinaison des deux. Appliqué aux catalogues d'outils, le Tool Search Tool d'Anthropic a réduit de 85 % la consommation de tokens et fait passer Opus 4.5 de 79,5 % à 88,1 % sur une évaluation MCP.
Le prix à payer, c'est le coût et la latence : chaque tour est un nouvel appel au modèle sur un contexte qui grossit, et la recherche web ajoute des frais (10 $ les 1 000 recherches chez Anthropic). Plafonnez les tours, journalisez chaque requête et gardez une recherche hybride en un seul passage pour les questions de type FAQ (voir les agents d'IA en production).
Évaluez la recherche et les réponses séparément
Mesurez trois couches : la recherche (recall@k : le bon passage figure-t-il parmi les k premiers ?), la fidélité (chaque affirmation est-elle étayée par les passages récupérés ?) et la qualité de la réponse (juste, complète, sourcée, dans la bonne langue). L'article Ragas (2023) a formalisé des métriques sans référence pour ces couches ; Ragas, DeepEval, promptfoo et Inspect, de l'AI Security Institute britannique, sont des options open source.
Les juges LLM font passer l'évaluation à l'échelle mais ont des biais de position, de longueur et de préférence pour leurs propres réponses. OpenAI recommande des jugements réussi/échoué ou par paires, de contrôler la longueur et de ne se fier à un juge qu'une fois qu'il concorde avec des annotations humaines. La méthode est dans notre guide d'évaluation des LLM.
Espagnol et français : quoi tester
- Accents et élisions dans la recherche par mots-clés : información contre informacion, l'entreprise contre entreprise.
- Vocabulaire régional : celular et móvil, computador et ordenador.
- Questions dans une langue sur des documents dans une autre, et termes anglais au milieu de textes espagnols ou français.
- Identifiants et formats numériques locaux : NIT, SIRET, 1.000,50 contre 1,000.50.
Intégrez ces cas à votre jeu de référence : un bon score sur un classement multilingue ne les garantit pas.
Droits d'accès et gouvernance des données en Colombie et en Europe
Filtrez avant de récupérer. Stockez les groupes d'accès avec chaque chunk, synchronisez-les depuis les systèmes sources (SharePoint, Drive, l'ERP) et appliquez-les comme filtres dans les requêtes vectorielles et par mots-clés. Tenir droits et fraîcheur à jour relève de la plateforme de données autant que de l'IA.
Traitez l'index comme une copie des données. Suppressions et corrections doivent atteindre les chunks, les embeddings et les caches. Le texte récupéré est aussi une entrée non fiable : en 2025, Brave a montré un agent de navigation qui transmettait le contenu des pages au modèle sans le séparer des instructions de l'utilisateur (voir injection de prompt et agents).
Colombie. La loi 1581 de 2012 s'applique aux traitements par IA : autorisation préalable, autorisation explicite pour les données sensibles, contrat de transmission avec les sous-traitants étrangers et article 26 pour les transferts internationaux. Europe. Le RGPD s'applique, et la résidence a un prix : les endpoints régionaux de Claude sur Bedrock et Google Cloud coûtent 10 % de plus, tout comme le traitement régional d'OpenAI pour les modèles sortis depuis le 5 mars 2026. Plus de détails dans notre carte réglementaire 2026.
Le modèle n'est pas un contrôle d'accès. Ne lui demandez jamais de masquer ce qu'un utilisateur n'a pas le droit de voir : tout ce qui atteint le prompt peut se retrouver dans la réponse.
Ce que cela coûte : un modèle aux hypothèses explicites
Hypothèses : 100 000 questions par mois ; un modèle de milieu de gamme à 2 $ par million de tokens en entrée et 10 $ par million en sortie (prix catalogue de GPT-6 Sol comme de Claude Sonnet 5) ; entrée en cache à 10 % du prix d'entrée ; rerank-2.5 de Voyage à 0,05 $ par million de tokens ; passages de 500 tokens. C'est de l'arithmétique sur les prix catalogue, pas la mesure d'un projet.
| Scénario | Tokens par requête | Par requête | Pour 100 000 requêtes |
|---|---|---|---|
| RAG hybride avec reranking | 6 000 en entrée, 500 en sortie, 50 passages reclassés | 0,018 $ | 1 825 $ |
| Recherche agentique, 4 tours | 50 000 en entrée, 1 500 en sortie sur 5 appels | 0,12 $ | 12 000 $ |
| Base entière de 200K tokens, en cache | 200 000 en cache plus 500 en entrée, 500 en sortie | 0,046 $ | 4 600 $ |
| Même base, sans cache | 200 500 en entrée, 500 en sortie | 0,406 $ | 40 600 $ |
| Prompt de 1M de tokens, en cache | 1 000 000 en cache plus 500 en entrée, 500 en sortie | 0,206 $ | 20 600 $ |
Trois lectures. L'indexation coûte peu : vectoriser un corpus de 100 millions de tokens revient à environ 13 $ avec text-embedding-3-large, et le contextualiser à environ 102 $ selon l'estimation d'Anthropic, moitié moins via les API batch. Même sous le seuil de 200K, à ce volume, le RAG coûte environ 2,5 fois moins qu'un prompt complet en cache : tout mettre dans le prompt l'emporte par sa simplicité, pas par le prix. Enfin, la recherche agentique coûte plusieurs fois le RAG classique : n'y envoyez que les questions qui en ont besoin. D'autres leviers dans le vrai coût de l'IA.
L'essentiel
- Une fenêtre d'un million de tokens relève le seuil du RAG sans le supprimer : la précision baisse avec la longueur et chaque requête paie toute la fenêtre.
- Sous environ 200 000 tokens de contenu stable, mettez tout en cache dans le prompt ; au-delà, ou avec des droits d'accès et des mises à jour fréquentes, utilisez la recherche.
- Chunks contextualisés, recherche hybride et reranker ont réduit de 67 % les échecs de récupération dans les tests d'Anthropic.
- Réservez la recherche agentique et GraphRAG aux questions en plusieurs étapes ou portant sur tout le corpus, avec un nombre de tours plafonné.
- Évaluez séparément recherche, fidélité et réponses, testez les cas limites en espagnol et en français, et appliquez les droits d'accès avant la recherche, jamais dans le prompt.
Sources
- Introducing Contextual Retrieval
- Lost in the Middle: How Language Models Use Long Contexts
- RULER: What's the Real Context Size of Your Long-Context Language Models?
- NoLiMa: Long-Context Evaluation Beyond Literal Matching
- Context Rot: How Increasing Input Tokens Impacts LLM Performance
- BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models
- ColPali: Efficient Document Retrieval with Vision Language Models
- From Local to Global: A Graph RAG Approach to Query-Focused Summarization
- LazyGraphRAG: Setting a new standard for quality and cost
- Semantic search for Cursor's agent
- Ragas: Automated Evaluation of Retrieval Augmented Generation
- Pricing
Note éditoriale : cette analyse reflète les informations publiques disponibles à la date de révision. Modèles, prix et règles évoluent vite ; chaque donnée tierce renvoie à sa source et nos opinions sont présentées comme telles. Une erreur ? Écrivez à contact@slash-digital.io.
Les questions qu'on nous pose souvent
Le RAG est-il encore nécessaire avec des fenêtres d'un million de tokens ?
Pour la plupart des entreprises, oui. La précision en contexte long baisse avec la longueur, chaque requête paie tous ses tokens, et les droits d'accès comme les mises à jour quotidiennes se gèrent mieux dans un index. Sous environ 200 000 tokens de contenu stable, un prompt en cache est une alternative valable.
Quel modèle d'embeddings choisir pour l'espagnol et le français ?
Il n'y a pas de réponse universelle, et nous n'avons pas pu vérifier le leader actuel de MTEB. Présélectionnez des modèles multilingues (Qwen3-Embedding, Gemini, Voyage, OpenAI) et comparez le recall@k sur quelques centaines de questions portant sur vos propres documents.
Ai-je besoin d'un reranker ?
Presque toujours. Dans les tests d'Anthropic, un reranker a fait passer les échecs de récupération de 2,9 % à 1,9 % en plus d'une recherche hybride contextualisée, et les rerankers spécialisés coûtent bien moins cher qu'un LLM généraliste pour cette tâche.
Quand GraphRAG vaut-il la peine ?
Quand les utilisateurs interrogent l'ensemble du corpus : thèmes, tendances ou relations entre des milliers de documents. Pour retrouver des faits précis, la recherche hybride avec reranking coûte moins et suffit en général ; LazyGraphRAG réduit le coût d'indexation si vous avez besoin des deux.
Comment empêcher un assistant RAG de divulguer des documents confidentiels ?
Stockez les droits d'accès avec chaque chunk, synchronisez-les depuis les systèmes sources et filtrez au moment de la requête, avant que quoi que ce soit n'atteigne le modèle. Les suppressions doivent atteindre l'index et les caches, et le texte récupéré doit être traité comme une entrée non fiable.
D'autres analyses à lire
Fine-tuning vs RAG : le critère
Quand le RAG, quand le fine-tuning et quand un hybride : l'ordre de décision avant de payer un entraînement.
Agents et ingénierieEvals : tester un système à base de LLM
Pourquoi tester à l'intuition échoue : jeu de référence en espagnol et en français, juges LLM calibrés, seuils bloquants en CI, outils et coût des evals.
Agents et ingénierieAgents IA en production : ce qui marche en 2026
Workflow ou agent, les huit briques, données d'adoption et d'échec, usage de l'ordinateur, règles de conception, coûts, sécurité et check-list.
Mettons-le en production
Racontez-nous votre défi. Nous répondons sous 24 heures ouvrées avec une première lecture honnête : si nous pouvons aider, nous dirons comment ; sinon, nous dirons qui peut.
Je réponds en personne. Pas de formulaires interminables ni de réponses automatiques.