En 2017, ocho investigadores de Google publicaron un artículo de doce páginas con un título audaz: «Attention Is All You Need». Estaban resolviendo un problema de traducción. Acabaron inventando el sustrato de una revolución cognitiva.
Un problema de memoria
Antes de los transformers, el enfoque dominante para modelar secuencias era la red neuronal recurrente. Las RNN procesaban las secuencias elemento a elemento, arrastrando un «estado oculto» —una representación comprimida de todo lo visto hasta ese punto— hacia el paso siguiente. Funcionaba. Pero tenía un defecto de fondo: la información del pasado lejano se perdía con facilidad. Cuando una RNN llegaba a la centésima palabra de una frase, su recuerdo de la primera se había desvanecido a menudo en ruido estadístico.
Las redes de memoria a corto y largo plazo (LSTM) se diseñaron para corregir esto, con compuertas capaces de recordar u olvidar de forma selectiva. Ayudaron. Pero eran lentas de entrenar, difíciles de paralelizar y seguían atascándose con las dependencias muy largas. El campo necesitaba otra cosa.
Nombre de tu producto
Una o dos frases sobre qué hace este producto y por qué encaja con quien lee este journal. Mantén el tono del texto que lo rodea: se lee mejor y convierte mejor.
Saber más →La idea de la atención
La intuición tras la atención es engañosamente simple: en lugar de intentar comprimir todo el contexto previo en un único vector, ¿por qué no dejar que el modelo mire directamente cualquier parte de la entrada que necesite? En cada paso, el modelo se pregunta: ¿qué partes de la secuencia son más relevantes para lo que estoy calculando ahora? Y toma después un promedio ponderado de esas partes relevantes.
Ese es el marco consulta-clave-valor. Cada token de una secuencia genera tres vectores: una consulta (qué busco), una clave (qué puedo ofrecer) y un valor (qué información llevo). Los pesos de atención se calculan emparejando consultas con claves —el producto escalar de Q y K— y usando después esos pesos para combinar los valores. El resultado: cada token puede atender directamente a cualquier otro, sin importar la distancia.
Giro clave El paso del procesamiento secuencial al paralelo no fue solo una ganancia de eficiencia. Fue un cambio cualitativo en lo que la arquitectura podía representar — y en la velocidad a la que podía entrenarse a escala.
«El mecanismo de atención no solo mejoró el modelado de secuencias. Convirtió la ventana de contexto en la unidad fundamental de la inteligencia, y todo lo demás se siguió de ahí.»
Adaptado de una conferencia de 2024, Stanford NLP GroupAtención multicabeza
La elaboración decisiva de Vaswani y sus colegas fue la atención multicabeza. En vez de calcular un solo conjunto de pesos de atención, el modelo calcula varios en paralelo, y cada «cabeza» aprende a atender a aspectos distintos de las relaciones entre tokens. Una puede especializarse en dependencias sintácticas (la concordancia entre sujeto y verbo). Otra, en semejanza semántica. Otra, en la estructura del discurso.
Las salidas de todas las cabezas se concatenan y se proyectan de vuelta a la dimensión oculta del modelo. El resultado es una representación más rica y matizada de cada token en contexto, capaz de capturar a la vez varios tipos de relación que una sola cabeza no podría.
Por qué lo cambió todo
El mecanismo de atención es hoy el corazón de prácticamente todos los sistemas frontera. Todo gran modelo de lenguaje —GPT-4, Claude, Gemini, LLaMA— se construye sobre la arquitectura transformer. Los modelos de generación de imágenes la usan (transformers de difusión). Los algoritmos de plegamiento de proteínas la usan (AlphaFold). Síntesis de código, descubrimiento de fármacos, modelado climático, análisis jurídico: transformers y atención, por todas partes.
La razón es simple: la arquitectura escala con elegancia. A medida que se añaden parámetros, capas y cabezas de atención, y se entrena con más datos, el rendimiento mejora de forma predecible. Ese fue el descubrimiento que abrió la era del escalado: no el artículo de las leyes de escalado, sino la arquitectura que hizo que escalar funcionara.
Los límites de la atención
La atención tiene un coste bien conocido: la complejidad computacional. La autoatención estándar escala cuadráticamente con la longitud de la secuencia: duplicar la ventana de contexto cuadruplica el cómputo necesario. Para secuencias cortas no hay problema. Para secuencias de millones de tokens resulta prohibitivo.
No es un reto menor de ingeniería. Es la razón de que los sistemas de IA sigan teniendo ventanas de contexto, límites duros de cuánto pueden sostener en mente a la vez. Toda técnica de la ola actual de investigación sobre extensión del contexto (atención dispersa, atención lineal, híbridos con modelos de espacio de estados) es, en el fondo, un intento de romper ese escalado cuadrático sin sacrificar la riqueza representacional que hace funcionar a la atención.
Problema abierto Si es posible lograr una representación con la calidad de la atención a complejidad subcuadrática sigue siendo una de las preguntas centrales del aprendizaje automático. La respuesta determinará si las ventanas de contexto siguen siendo una restricción dura o llegan a ser, con el tiempo, ilimitadas.