RAG en 2026: el contexto largo no mató la recuperación, la volvió más exigente
Los modelos ya leen un millón de tokens, y GraphRAG, la búsqueda agéntica y los embeddings multimodales maduraron. Aun así, la investigación sobre contexto largo, el costo y la latencia mantienen la recuperación en el centro de cualquier asistente de conocimiento serio. Este es el pipeline que recomendamos, lo que hay que probar en español y francés, y lo que cuesta.
Las ventanas de un millón de tokens ya son estándar en varios modelos de frontera, pero la recuperación sigue siendo la columna vertebral de un asistente de conocimiento serio. La investigación sobre contexto largo (Lost in the Middle, RULER, NoLiMa, el context rot de Chroma) muestra que la precisión cae cuando crece la entrada, y cada consulta sobre un corpus completo paga todos sus tokens.
El pipeline que funciona en 2026: parsing cuidadoso, chunks con contexto, búsqueda híbrida, un reranker, citas y filtros de acceso, más búsqueda agéntica para las preguntas de varios pasos. Por debajo de unos 200.000 tokens de contenido estable, el consejo de Anthropic sigue vigente: omite la recuperación y pon toda la base en caché.
¿Una ventana de 1M de tokens vuelve obsoleto el RAG?
No, pero mueve el umbral. Desde Claude 4.6, una petición de 900.000 tokens cuesta lo mismo por token que una de 9.000, y GPT-5.4 y DeepSeek V4 también ofrecen un millón de tokens; desde GPT-5.5, OpenAI cobra el doble por la entrada y 1,5 veces por la salida por encima de 272.000 tokens. La capacidad ya no es el límite. El costo, la latencia y la precisión, sí.
La precisión es lo menos intuitivo. Lost in the Middle (2023) mostró que los modelos aprovechan mejor la información al inicio y al final del contexto que en el medio. En RULER (2024), solo la mitad de 17 modelos que anunciaban 32K tokens o más aguantó a 32K. NoLiMa (2025) eliminó las coincidencias literales entre pregunta y respuesta: 11 de 13 modelos cayeron por debajo de la mitad de su puntaje en contexto corto a 32K. El estudio de context rot de Chroma (2025, 18 modelos) vio degradación incluso en tareas simples.
Los modelos nuevos lo hacen mejor (OpenAI reporta 96,3 % para GPT-6 Astra en su prueba de 8 agujas entre 512K y 1M de tokens), pero encontrar agujas no es razonar sobre un corpus desordenado, y cada consulta sigue pagando toda la ventana.
El umbral de Anthropic: con menos de unos 200.000 tokens (unas 500 páginas) de contenido que cambia poco, mete todo en el prompt con caché. Por encima de eso, o si hay permisos, actualizaciones frecuentes o citas obligatorias, construye recuperación.
El pipeline de 2026, paso a paso
- Parsea antes de vectorizar. Muchas fallas empiezan aquí: PDF a dos columnas, tablas aplanadas, páginas escaneadas. Conserva títulos, filas de tablas y números de página; manda los escaneos a OCR o a recuperación por imagen de página.
- Divide por estructura. Corta por secciones y párrafos, deja las tablas enteras y guarda los metadatos por los que vas a filtrar: fuente, fecha, idioma, responsable, grupos de acceso.
- Agrega contexto a cada chunk. El Contextual Retrieval de Anthropic antepone de 50 a 100 tokens que sitúan el fragmento en su documento antes de vectorizarlo e indexarlo en BM25; con caché de prompts, Anthropic calculó un costo único de USD 1,02 por millón de tokens de documentos.
- Busca en modo híbrido. BM25 atrapa términos exactos (códigos de producto, números de artículo, nombres) y los vectores, las paráfrasis. BEIR mostró que BM25 es una base robusta sin entrenamiento específico, mientras que los recuperadores densos suelen generalizar mal fuera de su dominio.
- Reordena. Recupera un conjunto amplio de candidatos (nosotros empezamos con 50 a 100), pásalo por un reranker y entrega al modelo los 5 a 20 mejores pasajes.
- Cita. Devuelve los identificadores de los pasajes con la respuesta y verifica automáticamente que cada cita exista en el texto recuperado.
Los pasos se suman. En las pruebas de Anthropic, las fallas de recuperación en el top 20 bajaron de 5,7 % a 3,7 % con embeddings contextuales, a 2,9 % al añadir BM25 contextual y a 1,9 % con un reranker: un 67 % menos en total.
Embeddings y rerankers disponibles en 2026
| Modelo | Tipo y acceso | Precio | Qué lo distingue |
|---|---|---|---|
| text-embedding-3-large (OpenAI) | Embedding, API | USD 0,13 | Hasta 3.072 dimensiones; 54,9 % en MIRACL multilingüe (ada-002: 31,4 %) |
| gemini-embedding-2 (Google) | Embedding multimodal, API | USD 0,20 texto, 0,45 imágenes | Texto, imágenes, video, audio y PDF en un mismo espacio |
| voyage-3.5 y 3.5-lite (Voyage AI) | Embedding, API | USD 0,06 y 0,02 | Voyage 4 añade un espacio común entre tamaños y un modelo nano abierto |
| Qwen3-Embedding-8B (Alibaba) | Embedding, abierto (Apache 2.0) | Autoalojado | N.º 1 en MTEB multilingüe el 5 de junio de 2025; contexto de 32K |
| EmbeddingGemma (Google) | Embedding, abierto | Autoalojado | 308M parámetros, menos de 200 MB cuantizado, más de 100 idiomas |
| Rerank 4 y 3.5 (Cohere) | Reranker, API | Ver proveedor | Multilingüe; Rerank 4 (diciembre de 2025) es el más preciso de Cohere |
| rerank-2.5 (Voyage AI) | Reranker, API | USD 0,05 | Contexto de 32K tokens, sigue instrucciones |
| Qwen3-Reranker 0.6B a 8B (Alibaba) | Reranker, abierto (Apache 2.0) | Autoalojado | Contexto de 32K, más de 100 idiomas |
Voyage afirma que un LLM general usado como reranker cuesta de 25 a 60 veces más que rerank-2.5 y es de 9 a 48 veces más lento (una afirmación del fabricante). Cambiar de modelo de embeddings obliga a revectorizar el corpus, así que para español y francés preselecciona modelos multilingües y decide con el recall@k sobre tus propios documentos.
Escaneos, presentaciones y grafos: más allá de los chunks de texto
Documentos visuales. ColPali (2024, ICLR 2025) vectoriza imágenes de página con un modelo de visión y lenguaje y las compara por interacción tardía; en el benchmark ViDoRe superó a los pipelines basados en OCR siendo más simple y rápido de indexar. gemini-embedding-2 y voyage-multimodal-3.5 también llevan imágenes y video al mismo espacio que el texto. Úsalos para presentaciones, formularios, gráficos y escaneos.
GraphRAG. GraphRAG de Microsoft (2024) construye un grafo de entidades y resúmenes por comunidad al indexar, y superó al RAG convencional en exhaustividad y diversidad en preguntas globales sobre corpus de alrededor de un millón de tokens, con un alto costo de indexación. LazyGraphRAG bajó la indexación al costo del RAG vectorial (0,1 % del GraphRAG completo) y, con el 4 % de su costo de consulta global, superó a los métodos que Microsoft comparó.
Nuestra regla: GraphRAG vale la pena para preguntas sobre todo el corpus (temas recurrentes en 5.000 contratos, vínculos entre proveedores), no para búsquedas puntuales.
Búsqueda agéntica: el modelo hace las consultas
En la búsqueda agéntica (agentic search), el modelo decide qué buscar, lee los resultados, reformula y vuelve a buscar, combinando palabras clave, vectores, SQL, API y listados de archivos. Sirve para preguntas de varios pasos y fuentes estructuradas.
Cursor reporta que añadir búsqueda semántica al grep de su agente subió la precisión de las respuestas un 12,5 % en promedio (de 6,5 % a 23,5 % según el modelo) en bases de código de más de 1.000 archivos, con los mejores resultados al combinar ambos. Aplicada a catálogos de herramientas, la Tool Search Tool de Anthropic redujo un 85 % el uso de tokens y llevó a Opus 4.5 de 79,5 % a 88,1 % en una evaluación de MCP.
El precio es costo y latencia: cada ronda es otra llamada al modelo sobre un contexto que crece, y la búsqueda web suma tarifas (USD 10 por cada 1.000 búsquedas en Anthropic). Limita las rondas, registra cada consulta y deja la recuperación híbrida de un solo paso para preguntas tipo FAQ (ver agentes de IA en producción).
Evalúa la recuperación y las respuestas por separado
Mide tres capas: recuperación (recall@k: si el pasaje correcto está entre los k primeros), fidelidad (si cada afirmación está respaldada por los pasajes recuperados) y calidad de la respuesta (correcta, completa, citada y en el idioma correcto). El artículo de Ragas (2023) formalizó métricas sin referencia para estas capas; Ragas, DeepEval, promptfoo e Inspect, del Instituto de Seguridad de IA del Reino Unido, son opciones de código abierto.
Los jueces LLM escalan el trabajo, pero tienen sesgos de posición, de extensión y de preferencia por sus propias respuestas. OpenAI recomienda juicios de aprobado o reprobado, o por pares, controlar la longitud y confiar en un juez solo cuando coincide con etiquetas humanas. El método, en nuestra guía de evaluación de LLM.
Español y francés: qué probar
- Tildes y elisiones en la búsqueda por palabras clave: información frente a informacion, l'entreprise frente a entreprise.
- Vocabulario regional: celular y móvil, computador y ordenador.
- Preguntas en un idioma sobre documentos en otro, y términos en inglés dentro de textos en español o francés.
- Identificadores y formatos numéricos locales: NIT, SIRET, 1.000,50 frente a 1,000.50.
Mete estos casos en tu conjunto de referencia: un buen puntaje en un ranking multilingüe no los garantiza.
Permisos y gobierno de datos en Colombia y Europa
Filtra antes de recuperar. Guarda los grupos de acceso con cada chunk, sincronízalos desde los sistemas de origen (SharePoint, Drive, el ERP) y aplícalos como filtros dentro de las consultas vectoriales y por palabras clave. Mantener permisos y frescura al día es trabajo de plataforma de datos tanto como de IA.
Trata el índice como una copia de los datos. Las eliminaciones y correcciones deben llegar a los chunks, los embeddings y las cachés. El texto recuperado también es una entrada no confiable: en 2025, Brave mostró un agente de navegador que pasaba el contenido de las páginas al modelo sin separarlo de las instrucciones del usuario (ver prompt injection y agentes).
Colombia. La Ley 1581 de 2012 aplica al tratamiento con IA: autorización previa, autorización explícita para datos sensibles, contrato de transmisión con los encargados extranjeros y el artículo 26 para las transferencias internacionales. Europa. Aplica el RGPD, y la residencia cuesta: los endpoints regionales de Claude en Bedrock y Google Cloud cuestan un 10 % más, igual que el procesamiento regional de OpenAI en los modelos lanzados desde el 5 de marzo de 2026. Más en nuestro mapa regulatorio de 2026.
El modelo no es un control de acceso. Nunca le pidas que oculte lo que un usuario no puede ver: todo lo que llega al prompt puede terminar en la respuesta.
Cuánto cuesta: un modelo con supuestos explícitos
Supuestos: 100.000 preguntas al mes; un modelo de gama media a USD 2 por millón de tokens de entrada y USD 10 por millón de salida (precio de lista de GPT-6 Sol y de Claude Sonnet 5); entrada en caché al 10 % del precio de entrada; rerank-2.5 de Voyage a USD 0,05 por millón de tokens; pasajes de 500 tokens. Es aritmética sobre precios de lista, no la medición de un proyecto.
| Escenario | Tokens por consulta | Por consulta | Por 100.000 consultas |
|---|---|---|---|
| RAG híbrido con reranking | 6.000 de entrada, 500 de salida, 50 pasajes reordenados | USD 0,018 | USD 1.825 |
| Búsqueda agéntica, 4 rondas | 50.000 de entrada, 1.500 de salida en 5 llamadas | USD 0,12 | USD 12.000 |
| Base completa de 200K tokens, en caché | 200.000 en caché más 500 de entrada, 500 de salida | USD 0,046 | USD 4.600 |
| La misma base, sin caché | 200.500 de entrada, 500 de salida | USD 0,406 | USD 40.600 |
| Prompt de 1M de tokens, en caché | 1.000.000 en caché más 500 de entrada, 500 de salida | USD 0,206 | USD 20.600 |
Tres lecturas. Indexar es barato: vectorizar un corpus de 100 millones de tokens cuesta unos USD 13 con text-embedding-3-large, y contextualizarlo unos USD 102 según la estimación de Anthropic, la mitad con las API de lotes. Incluso por debajo del umbral de 200K, a este volumen el RAG cuesta unas 2,5 veces menos que un prompt completo en caché: meterlo todo gana por simplicidad, no por precio. Y la búsqueda agéntica cuesta varias veces el RAG clásico, así que envíale solo las preguntas que la necesitan. Más palancas en el costo real de la IA.
Lo esencial
- Una ventana de 1M de tokens sube el umbral del RAG sin eliminarlo: la precisión se degrada con la longitud y cada consulta paga toda la ventana.
- Con menos de unos 200.000 tokens de contenido estable, pon todo en el prompt con caché; por encima, o con permisos y actualizaciones frecuentes, usa recuperación.
- Chunks con contexto, búsqueda híbrida y un reranker redujeron un 67 % las fallas de recuperación en las pruebas de Anthropic.
- Reserva la búsqueda agéntica y GraphRAG para preguntas de varios pasos o sobre todo el corpus, con rondas limitadas.
- Evalúa por separado recuperación, fidelidad y respuestas, prueba los casos límite en español y francés, y aplica los permisos antes de recuperar, nunca en el prompt.
Fuentes
- Introducing Contextual Retrieval
- Lost in the Middle: How Language Models Use Long Contexts
- RULER: What's the Real Context Size of Your Long-Context Language Models?
- NoLiMa: Long-Context Evaluation Beyond Literal Matching
- Context Rot: How Increasing Input Tokens Impacts LLM Performance
- BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models
- ColPali: Efficient Document Retrieval with Vision Language Models
- From Local to Global: A Graph RAG Approach to Query-Focused Summarization
- LazyGraphRAG: Setting a new standard for quality and cost
- Semantic search for Cursor's agent
- Ragas: Automated Evaluation of Retrieval Augmented Generation
- Pricing
Nota editorial: este análisis refleja la información pública disponible en la fecha de revisión. Modelos, precios y normas cambian rápido; cada dato de terceros enlaza a su fuente y nuestras opiniones se presentan como tales. ¿Ves un error? Escríbenos a contact@slash-digital.io.
Las preguntas que escuchamos a menudo
¿Sigue siendo necesario el RAG con ventanas de 1M de tokens?
Para la mayoría de las empresas, sí. La precisión en contexto largo se degrada con la longitud, cada consulta paga todos los tokens y los permisos o las actualizaciones diarias se manejan mejor en un índice. Por debajo de unos 200.000 tokens de contenido estable, un prompt en caché es una alternativa válida.
¿Qué modelo de embeddings es mejor para español y francés?
No hay una respuesta universal, y no pudimos verificar el líder actual de MTEB. Preselecciona modelos multilingües (Qwen3-Embedding, Gemini, Voyage, OpenAI) y compara el recall@k con unos cientos de preguntas sobre tus propios documentos.
¿Necesito un reranker?
Casi siempre. En las pruebas de Anthropic, un reranker bajó las fallas de recuperación de 2,9 % a 1,9 % sobre una búsqueda híbrida con contexto, y los rerankers dedicados cuestan mucho menos que usar un LLM general para esa tarea.
¿Cuándo vale la pena GraphRAG?
Cuando los usuarios preguntan por todo el corpus: temas, patrones o relaciones entre miles de documentos. Para consultar datos puntuales, la búsqueda híbrida con reranking es más barata y suele bastar; LazyGraphRAG reduce el costo de indexación si necesitas ambos.
¿Cómo evito que un asistente RAG filtre documentos confidenciales?
Guarda los permisos con cada chunk, sincronízalos desde los sistemas de origen y filtra en el momento de la consulta, antes de que algo llegue al modelo. Las eliminaciones deben llegar al índice y a las cachés, y el texto recuperado debe tratarse como una entrada no confiable.
Más análisis para seguir
Fine-tuning vs RAG: el criterio
Cuándo RAG, cuándo fine-tuning y cuándo un híbrido: el orden de decisión antes de pagar un entrenamiento.
Agentes e ingenieríaEvals: cómo probar un sistema con LLM
Por qué probar a ojo falla: set de oro en español y francés, jueces LLM calibrados, gates de regresión en CI, herramientas y cuánto cuesta evaluar.
Agentes e ingenieríaAgentes de IA en producción: lo que funciona en 2026
Flujo o agente, los ocho componentes, datos de adopción y fracaso, uso de computador, reglas de diseño, costos, seguridad y checklist de lanzamiento.
Pongámoslo en producción
Cuéntanos tu reto. Respondemos en menos de 24 horas laborales con una primera lectura honesta: si podemos ayudarte, te diremos cómo; si no, te diremos quién puede.
Contesto personalmente. Sin formularios eternos ni respuestas automáticas.