En 2017, ocho investigadores de Google publicaron un artículo de doce páginas con un título audaz: «Attention Is All You Need». Estaban resolviendo un problema de traducción. Acabaron inventando el sustrato de una revolución cognitiva.

Un problema de memoria

Antes de los transformers, el enfoque dominante para modelar secuencias era la red neuronal recurrente. Las RNN procesaban las secuencias elemento a elemento, arrastrando un «estado oculto» —una representación comprimida de todo lo visto hasta ese punto— hacia el paso siguiente. Funcionaba. Pero tenía un defecto de fondo: la información del pasado lejano se perdía con facilidad. Cuando una RNN llegaba a la centésima palabra de una frase, su recuerdo de la primera se había desvanecido a menudo en ruido estadístico.

Las redes de memoria a corto y largo plazo (LSTM) se diseñaron para corregir esto, con compuertas capaces de recordar u olvidar de forma selectiva. Ayudaron. Pero eran lentas de entrenar, difíciles de paralelizar y seguían atascándose con las dependencias muy largas. El campo necesitaba otra cosa.

Partner · Enlace de afiliado

Nombre de tu producto

Una o dos frases sobre qué hace este producto y por qué encaja con quien lee este journal. Mantén el tono del texto que lo rodea: se lee mejor y convierte mejor.

Saber más

La idea de la atención

La intuición tras la atención es engañosamente simple: en lugar de intentar comprimir todo el contexto previo en un único vector, ¿por qué no dejar que el modelo mire directamente cualquier parte de la entrada que necesite? En cada paso, el modelo se pregunta: ¿qué partes de la secuencia son más relevantes para lo que estoy calculando ahora? Y toma después un promedio ponderado de esas partes relevantes.

Ese es el marco consulta-clave-valor. Cada token de una secuencia genera tres vectores: una consulta (qué busco), una clave (qué puedo ofrecer) y un valor (qué información llevo). Los pesos de atención se calculan emparejando consultas con claves —el producto escalar de Q y K— y usando después esos pesos para combinar los valores. El resultado: cada token puede atender directamente a cualquier otro, sin importar la distancia.

Antes (RNN)
Procesamiento secuencial
La información fluye estrictamente de izquierda a derecha. Cada paso depende del estado oculto anterior. Las dependencias largas se degradan con la distancia. No se puede paralelizar el entrenamiento: cada paso debe esperar al previo.
Después (transformers)
Atención en paralelo
Cada token atiende a todos los demás simultáneamente. Sin cuello de botella de información. Las dependencias largas cuestan lo mismo que las cortas. Masivamente paralelizable: la secuencia entera se procesa de una vez.

Giro clave El paso del procesamiento secuencial al paralelo no fue solo una ganancia de eficiencia. Fue un cambio cualitativo en lo que la arquitectura podía representar — y en la velocidad a la que podía entrenarse a escala.

«El mecanismo de atención no solo mejoró el modelado de secuencias. Convirtió la ventana de contexto en la unidad fundamental de la inteligencia, y todo lo demás se siguió de ahí.»

Adaptado de una conferencia de 2024, Stanford NLP Group

Atención multicabeza

La elaboración decisiva de Vaswani y sus colegas fue la atención multicabeza. En vez de calcular un solo conjunto de pesos de atención, el modelo calcula varios en paralelo, y cada «cabeza» aprende a atender a aspectos distintos de las relaciones entre tokens. Una puede especializarse en dependencias sintácticas (la concordancia entre sujeto y verbo). Otra, en semejanza semántica. Otra, en la estructura del discurso.

Las salidas de todas las cabezas se concatenan y se proyectan de vuelta a la dimensión oculta del modelo. El resultado es una representación más rica y matizada de cada token en contexto, capaz de capturar a la vez varios tipos de relación que una sola cabeza no podría.

Por qué lo cambió todo

El mecanismo de atención es hoy el corazón de prácticamente todos los sistemas frontera. Todo gran modelo de lenguaje —GPT-4, Claude, Gemini, LLaMA— se construye sobre la arquitectura transformer. Los modelos de generación de imágenes la usan (transformers de difusión). Los algoritmos de plegamiento de proteínas la usan (AlphaFold). Síntesis de código, descubrimiento de fármacos, modelado climático, análisis jurídico: transformers y atención, por todas partes.

La razón es simple: la arquitectura escala con elegancia. A medida que se añaden parámetros, capas y cabezas de atención, y se entrena con más datos, el rendimiento mejora de forma predecible. Ese fue el descubrimiento que abrió la era del escalado: no el artículo de las leyes de escalado, sino la arquitectura que hizo que escalar funcionara.

2017
«Attention Is All You Need»
Vaswani y sus colegas presentan la arquitectura transformer en NeurIPS. El artículo apunta a la traducción automática. Casi nadie predice lo que vendrá después.
2018
BERT y GPT-1
El BERT de Google y el GPT de OpenAI demuestran que preentrenar transformers sobre grandes corpus de texto produce representaciones que se transfieren notablemente bien a tareas posteriores. Nace el paradigma del preentrenamiento.
2020
GPT-3 y la revelación del escalado
OpenAI escala el transformer a 175.000 millones de parámetros. El modelo exhibe capacidades emergentes sorprendentes —aprendizaje con pocos ejemplos, síntesis de código, razonamiento— que nadie entrenó explícitamente. La escala se vuelve estrategia.
2022–2024
La atención más allá del texto
Los transformers de visión (ViT), los de difusión, AlphaFold 2 (que usa atención para la estructura de proteínas) y los modelos multimodales demuestran que la atención generaliza mucho más allá del lenguaje.
2025–2026
La pregunta por la arquitectura
Con los transformers ya omnipresentes, los investigadores empiezan a preguntarse: ¿es óptima la atención, o solo lo mejor que hemos encontrado? Los modelos de espacio de estados, la mezcla de expertos y las arquitecturas híbridas tantean qué puede venir después.

Los límites de la atención

La atención tiene un coste bien conocido: la complejidad computacional. La autoatención estándar escala cuadráticamente con la longitud de la secuencia: duplicar la ventana de contexto cuadruplica el cómputo necesario. Para secuencias cortas no hay problema. Para secuencias de millones de tokens resulta prohibitivo.

No es un reto menor de ingeniería. Es la razón de que los sistemas de IA sigan teniendo ventanas de contexto, límites duros de cuánto pueden sostener en mente a la vez. Toda técnica de la ola actual de investigación sobre extensión del contexto (atención dispersa, atención lineal, híbridos con modelos de espacio de estados) es, en el fondo, un intento de romper ese escalado cuadrático sin sacrificar la riqueza representacional que hace funcionar a la atención.

Problema abierto Si es posible lograr una representación con la calidad de la atención a complejidad subcuadrática sigue siendo una de las preguntas centrales del aprendizaje automático. La respuesta determinará si las ventanas de contexto siguen siendo una restricción dura o llegan a ser, con el tiempo, ilimitadas.