Todo modelo transformer tiene un límite duro de cuánto puede sostener en mente a la vez. No es un fallo que se parchea: es una restricción arquitectónica de fondo, con implicaciones profundas sobre lo que la IA puede y no puede hacer.

Pida a un modelo de lenguaje que resuma un libro de 500 páginas. Le costará, y no por falta de capacidad lectora, sino porque no puede mantener el libro entero dentro de su atención a la vez. Déle una base de código de 200.000 líneas y pídale refactorizar un módulo que depende de patrones dispersos por todas partes. Se le escaparán cosas, no por descuido, sino porque buena parte del código queda más allá del borde de lo que alcanza a ver.

Esa restricción tiene nombre: la ventana de contexto. Es la limitación arquitectónica más determinante de los sistemas actuales y, se puede defender, lo que separa las herramientas impresionantes pero acotadas de hoy de una IA capaz de actuar de verdad como colaboradora persistente en proyectos largos y dominios complejos.

Qué es realmente una ventana de contexto

Cuando un transformer procesa texto, calcula pesos de atención entre cada token y todos los demás de la secuencia. Eso es lo que le da su notable capacidad para seguir dependencias a larga distancia: un pronombre 200 tokens más adelante que remite a un nombre introducido 200 tokens antes, por ejemplo. Pero ese cálculo entre todos los pares tiene un coste que crece cuadráticamente con la longitud de la secuencia.

Duplique la ventana de contexto y el cálculo de atención no se duplica: se cuadruplica. Por eso los primeros transformers tenían ventanas de 512 o 1.024 tokens, por eso GPT-3 operaba con 2.048 y por eso incluso las ventanas actuales de 128.000 tokens o de un millón representan proezas de ingeniería que consumen órdenes de magnitud más cómputo que el mismo modelo sobre secuencias cortas.

2K
Tokens de la ventana original de GPT-3: unas 1.500 palabras, o cerca de 6 páginas de texto
1M
Tokens de ventana en Gemini 1.5 Pro: suficiente para unas 750.000 palabras, o una pila de novelas
O(n²)
Complejidad computacional de la atención estándar: la razón de fondo de que ampliar el contexto salga caro
Partner · Enlace de afiliado

Nombre de tu producto

Una o dos frases sobre qué hace este producto y por qué encaja con quien lee este journal. Mantén el tono del texto que lo rodea: se lee mejor y convierte mejor.

Saber más

Qué se pierde

La ventana de contexto no es solo una limitación técnica: es cognitiva. Todo lo que queda fuera simplemente no está disponible para el modelo. No se desvanece ni se emborrona: desaparece por completo. Eso hace especialmente interesante estudiar cómo se comportan estos sistemas cerca de su frontera de contexto.

La investigación ha documentado lo que se conoce como el fenómeno de «perderse en el medio»: los modelos atienden desproporcionadamente a la información del principio y del final de los contextos largos, mientras que lo enterrado en el centro queda sistemáticamente infraponderado. La implicación inquieta. Incluso dentro de la ventana declarada, no todos los tokens son iguales. Los bordes de la memoria son a la vez el límite y el mejor sitio.

La ventana de contexto no es memoria de trabajo. Se parece más a un foco. Y el foco tiene un borde afilado.

— Atribuido a un investigador en NeurIPS 2025, parafraseado

La analogía con la memoria humana

La memoria humana funciona de forma muy distinta. Tenemos varios sistemas solapados: memoria de trabajo (lo que sostenemos activamente, de capacidad muy limitada), memoria episódica (experiencias concretas, recuperables por señales), memoria semántica (conocimiento general, difuso y asociativo) y memoria procedimental (destrezas y hábitos, en buena medida inaccesibles a la introspección).

Los transformers no tienen nada de esa arquitectura. Su «memoria» llega en dos formas: la ventana de contexto (temporal, descartada tras cada llamada de inferencia) y los propios pesos (fijos tras el entrenamiento, que codifican patrones estadísticos de miles de millones de documentos). No hay hipocampo que consolide. Ni almacén episódico que consultar. Ni memoria a largo plazo que se acumule entre conversaciones. Cada conversación empieza, en un sentido real, desde cero.

Memoria humana
Multisistema, persistente
De trabajo, episódica, semántica, procedimental. Las experiencias se acumulan a lo largo de una vida. Los recuerdos relevantes se recuperan de forma asociativa, no secuencial. La consolidación ocurre durmiendo. El sistema evoluciona sin parar.
«Memoria» del transformer
Dos sistemas, ambos limitados
Ventana de contexto (temporal, de coste cuadrático) y pesos del modelo (congelados tras el entrenamiento). Nada persiste entre conversaciones. Sin consolidación. Sin recuperación de experiencias pasadas. Cada sesión es una pizarra en blanco.

Qué están probando los investigadores

El problema de la memoria es una de las áreas más activas de la investigación en IA. Los enfoques se agrupan en tres estrategias: ampliar la ventana de contexto, añadir memoria externa o repensar la arquitectura de raíz.

01
Variantes eficientes de atención
La atención dispersa (atender a un subconjunto de tokens), la atención lineal (aproximar la atención completa con coste lineal), la atención por ventana deslizante y Flash Attention (una implementación eficiente en hardware) buscan reducir el coste O(n²). Vuelven manejables contextos más largos, pero no eliminan el compromiso de fondo.
02
Generación aumentada por recuperación (RAG)
En vez de meterlo todo en la ventana, recuperar solo lo relevante. Una base de datos vectorial guarda incrustaciones de documentos; en la inferencia se recuperan los fragmentos más pertinentes y se insertan en el contexto. Esto esquiva el límite pero introduce problemas nuevos: qué recuperar, cómo ordenar la relevancia, cómo tratar los casos en que la información relevante se reparte entre fragmentos.
03
Modelos de espacio de estados
Arquitecturas como Mamba sustituyen la atención por una representación de estado recurrente que se actualiza continuamente conforme se procesa la secuencia. El coste crece de forma lineal. El precio: el estado comprimido pierde información inevitablemente. Si los SSM pueden igualar la calidad del transformer en contextos largos sigue siendo un debate abierto; los primeros resultados son prometedores, no concluyentes.
04
Sistemas de memoria externa
Dar al modelo acceso a un almacenamiento persistente y escribible que pueda leer y modificar explícitamente. Es el enfoque de los marcos de agentes. El modelo razona sobre qué guardar, cuándo recuperarlo y cómo integrar lo recuperado con su razonamiento actual. Lo más cercano en espíritu a la memoria episódica humana — y lo más lejos de estar resuelto.

Por qué importa más allá de la ingeniería

El problema de la ventana de contexto suele plantearse como un reto técnico: hacer la atención más rápida, construir mejores sistemas de recuperación. Pero tiene implicaciones más hondas sobre qué pueden llegar a ser estos sistemas.

Un médico construye un modelo detallado de un paciente a lo largo de años de consultas. Un abogado entiende la situación de su cliente a través de una red de asuntos entrelazados que se remonta décadas. Quien colabora en un proyecto creativo largo lleva consigo una comprensión compartida y en evolución de sus temas, restricciones e historia. Ese tipo de comprensión persistente y acumulada es precisamente lo que los sistemas actuales no pueden hacer. Pueden simularla dentro de una conversación. No pueden sostenerla en el tiempo.

Implicación No es solo una brecha de capacidad. Es una brecha de confianza. Confiamos en profesionales y colaboradores en parte porque recuerdan: tienen contexto, historia y criterio acumulado. Una IA que olvida todo en cuanto termina la sesión no puede, del mismo modo, ser un socio genuino a largo plazo. Resolver el problema de la memoria no va solo de hacer la IA más capaz. Va de convertirla en otra clase de cosa.

La ventana de contexto es, en este sentido, el marcador más legible de la distancia entre lo que la IA es hoy y lo que podría llegar a ser. Cada token más allá del límite actual recuerda que la inteligencia, por ahora, todavía tiene un borde — y que más allá de ese borde todo desaparece.