Cuando la gente dice "hay que darle contexto a la IA", habla como si fuera una sola cosa. No lo es. Gestionar el contexto es una escalera de seis peldaños, y cada uno resuelve un problema distinto: desde pegar un archivo en el chat hasta entrenar un modelo dedicado. Subir un peldaño de más cuesta dinero y complejidad. Quedarte corto hace que tu asistente improvise. Aquí te enseño la escalera completa, para que sepas exactamente en qué peldaño parar.
La respuesta corta, para el que tiene prisa: la mayoría de las personas y equipos viven felices entre el nivel 1 y el 4. Solo llegas a bases vectoriales o a modelos dedicados cuando el volumen de información deja de caber en la cabeza del modelo. Y casi nunca conviene empezar por arriba.
01 · el escalónLos seis niveles, de un vistazo
Antes de bajar al detalle, quédate con la escalera entera. Cada peldaño no reemplaza al anterior: lo abraza. Un buen sistema de nivel 5 sigue usando prompts (nivel 1) por debajo.
02 · el sueloNivel 1: un prompt, un archivo
El punto de partida es pegar información directamente en la conversación: un prompt largo, o un archivo adjunto. Aquí hay una regla que casi nadie te dice: el formato importa. Un archivo de texto plano o Markdown (.md) es el ideal, porque el modelo lo lee tal cual, limpio. Un PDF, un Word o una foto añaden ruido: hay que extraer el texto, y en el camino aparecen errores de reconocimiento óptico (OCR), columnas mal ordenadas, tablas rotas. Le estás dando de comer con tierra pegada.
El otro límite del nivel 1 aparece cuando la conversación crece. Mucha gente cree que "el modelo se olvida" o "se cansa". No es eso. El modelo no pierde sus pesos base, esa gigantesca red de conocimiento con la que fue entrenado sigue intacta. Lo que se degrada son las instrucciones que pusiste en el contexto: a medida que la conversación se alarga, esas indicaciones se diluyen entre miles de palabras nuevas.
El modelo no olvida lo que sabe. Se le diluye lo que le acabas de decir.
Hay incluso un fenómeno con nombre propio: lost in the middle ("perdido en el medio"). Los modelos atienden mejor a lo que está al principio y al final del contexto, y prestan menos atención a lo que quedó en el centro [1]. Así que un dato clave enterrado en mitad de un documento largo puede pasar desapercibido, aunque técnicamente esté "dentro" de la ventana.
Si algo es crítico, ponlo al principio o al final de tu mensaje, no en el medio de un bloque enorme. Y cuando puedas, entrega la fuente en Markdown limpio en vez de un PDF escaneado. Le ahorras al modelo un trabajo de descifrado en el que se cometen errores.
03 · el proyectoNiveles 2 y 3: chats que nacen entrenados y agentes que se instancian
El nivel 2 aparece cuando pasas de un chat suelto a un proyecto. Herramientas como Claude Projects o los proyectos de ChatGPT te dejan cargar varios archivos y unas instrucciones fijas, de modo que cada chat nuevo nace ya entrenado con ese material. No tienes que volver a pegar el contexto cada vez: vive en el proyecto y acompaña a todas las conversaciones que abras dentro.
El nivel 3 sube la apuesta: son IAs que ya no solo conversan, sino que codifican e instancian a otras. Aparecen los agentes (un asistente con una misión y herramientas), los subagentes (agentes que otro agente lanza para tareas concretas) y las skills (paquetes de instrucciones y capacidades reutilizables). Aquí el contexto deja de ser un archivo pegado y pasa a ser una arquitectura: quién sabe qué, quién delega en quién. Y, ojo, todo esto se sigue haciendo con Markdown: los archivos .md son el lenguaje común con el que se describen agentes y skills.
04 · el desordenNivel 4: cuando 20 archivos te llenan la ventana
Llega un momento incómodo. Tienes, digamos, veinte archivos sin una estructura clara, y entre todos llenan la ventana de contexto. El modelo se ahoga: demasiada información compitiendo por su atención, y de nuevo el problema del "perdido en el medio". Meterlo todo de golpe deja de funcionar.
La solución del nivel 4 no es más memoria, es mejor organización. Tres piezas clave:
Skills y baúles. En vez de cargar todo siempre, agrupas el conocimiento en módulos que se activan cuando hacen falta. El baúl es el almacén; la skill es la instrucción que sabe cuándo abrirlo.
Encabezados-resumen por archivo. A cada documento le pones arriba un resumen corto de qué contiene. Así el modelo puede leer solo los encabezados, decidir cuáles archivos le sirven, y abrir a fondo únicamente esos. Es lo que se llama divulgación progresiva (progressive disclosure): mostrar primero lo mínimo, y profundizar solo bajo demanda.
No se trata de que el modelo lea más. Se trata de que lea lo justo, en el orden justo.
05 · la memoria externaNivel 5: bases vectoriales, sin magia y sin SQL
Cuando la información es tanta que ni siquiera cabe en índices y resúmenes, se saca del contexto y se guarda fuera, en una base vectorial. Este es el corazón de lo que llaman RAG (recuperación aumentada por generación). Vamos por partes, porque aquí abundan las explicaciones confusas.
Primero se hace chunking: partir los documentos en trozos manejables (párrafos, secciones). Luego, a cada trozo se le calcula un embedding: una lista de números que representa su significado. Textos que dicen cosas parecidas tienen embeddings cercanos en ese espacio numérico, aunque usen palabras distintas.
Cuando haces una pregunta, tu pregunta también se convierte en un embedding, y el sistema busca los trozos cuyos vectores se le parecen más. Esa comparación se hace por similitud: típicamente la del coseno (el ángulo entre dos vectores) o una búsqueda de vecinos más cercanos. Aclaremos un malentendido común: esto no es "SQL más ecuaciones" en el sentido literal de una base de datos tradicional. Es una búsqueda por parecido semántico, no por coincidencia exacta de campos.
Un matiz técnico útil: esos vectores no se guardan siempre en crudo. Se comprimen, con técnicas de cuantización (guardar los números con menos precisión) o de reducción de dimensión (usar menos números por vector). Se pierde un pelín de fidelidad a cambio de que la búsqueda sea mucho más rápida y barata a gran escala.
Una base vectorial es una memoria externa que recupera por significado. En vez de meterle al modelo todos los documentos, le entregas solo los tres o cuatro trozos que más se parecen a la pregunta. La ventana se mantiene ligera y la respuesta se apoya en fuentes reales.
06 · el modelo propioNivel 6: fine-tuning, y por qué casi nunca es lo primero
El último peldaño es el fine-tuning: seguir entrenando un modelo con tus propios datos para obtener uno dedicado. Suena como la solución definitiva, pero conviene un matiz que ahorra mucho dinero: el fine-tuning ajusta el comportamiento más que inyecta conocimiento. Sirve para fijar un tono, un formato, un estilo de respuesta o una tarea muy específica. No es el mejor camino para "meterle" datos frescos o cambiantes, porque cada vez que la información cambia habría que reentrenar.
Para conocimiento que cambia, primero RAG. El fine-tuning es para moldear cómo responde, no qué sabe.
Por eso la recomendación práctica, casi un mantra en la industria, es RAG antes que fine-tune: si tu problema es que el modelo necesita datos que no tenía, una base vectorial (nivel 5) suele resolverlo mejor, más barato y sin reentrenar. El fine-tuning entra cuando lo que falla es el comportamiento, no el conocimiento.
07 · el techoLa frontera: agrandar la ventana rinde cada vez menos
¿Y por qué no simplemente hacer ventanas de contexto gigantes y meterlo todo dentro? Porque ahí está la frontera real del campo, y no es gratis. Optimizar un sistema de IA es un equilibrio entre tres cosas: el serving (servir las respuestas rápido y a muchos usuarios), el tamaño de la ventana y el cómputo disponible. Los tres tiran en direcciones opuestas.
Y agrandar la ventana tiene rendimientos decrecientes. Duplicar el contexto no duplica la calidad: el coste de cómputo crece rápido, y reaparecen los viejos problemas (lo perdido en el medio, la dilución de instrucciones). Por eso la respuesta a "necesito más contexto" casi nunca es "una ventana más grande", sino "una mejor gestión del contexto": la escalera que acabamos de recorrer.
08 · la prácticaDónde encaja Qirava en la escalera
Todo esto no es teoría de laboratorio: es exactamente el problema que enfrenta cualquiera que quiera que su IA recuerde su trabajo. Qirava está pensado para acompañar esa escalera de forma ordenada, sin saltos bruscos. Empieza donde empiezas tú, con el baúl (nivel 4): un lugar donde tu conocimiento vive organizado, con encabezados-resumen para que la IA lea lo justo. A medida que ese conocimiento crece, el camino natural es sumar resúmenes más finos y, cuando el volumen lo pide, dar el paso a la recuperación vectorial (nivel 5).
No te promete un modelo dedicado ni magia de nivel 6 desde el día uno, porque casi nadie lo necesita al empezar y prometerlo sería venderte humo. Te promete algo más útil: subir la escalera un peldaño a la vez, cuando de verdad hace falta, sin pagar de más por complejidad que no vas a usar. Esa es, al final, la única forma sana de darle contexto a una IA.
Fuentes
- Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F. & Liang, P. (2024). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics (TACL), vol. 12, pp. 157-173. ACL Anthology: aclanthology.org/2024.tacl-1.9.
- Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems (NeurIPS) 33, pp. 9459-9474. (Origen del enfoque RAG.)
- Anthropic (2024). Introducing Contextual Retrieval. anthropic.com/news/contextual-retrieval. (Chunking, embeddings y recuperación en la práctica.)
- Ouyang, L., Wu, J., Jiang, X. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. NeurIPS 35. (El fine-tuning ajusta comportamiento más que conocimiento.)