La arquitectura transformer no se diseñó para modelar el cerebro. Sus inventores resolvían un problema de traducción. Y, sin embargo, los neurocientíficos no dejan de encontrar que reproduce patrones de la cognición humana que a la evolución le costaron millones de años.

En 2017, un equipo de Google Brain publicó «Attention Is All You Need», un artículo que sustituyó las redes recurrentes por un mecanismo llamado autoatención. El objetivo era la eficiencia. Entrenar más rápido. Traducir mejor. Nadie pensaba en columnas corticales ni en la reactivación hipocampal. Y, sin embargo, en los años siguientes, investigadores de neurociencia y ciencia cognitiva se han sorprendido repitiendo la misma frase incómoda en voz baja: esto me resulta familiar.

Atención y foco selectivo

El mecanismo de atención del transformer permite que cada token de una secuencia «atienda» a todos los demás, ponderando la relevancia de forma dinámica y en contexto. No era así como funcionaban las redes neuronales anteriores. Y se parece asombrosamente a cómo describen los neurocientíficos la atención selectiva en el cerebro humano.

Cuando usted lee una frase, su córtex visual no procesa cada palabra con el mismo peso. Su cerebro asigna relevancia dinámicamente, suprimiendo lo irrelevante y amplificando lo que importa. El tálamo actúa como una especie de compuerta que decide qué llega al procesamiento consciente. Paralelismo Los transformers implementan una versión matemática de exactamente eso: una función de compuerta aprendida que selecciona lo que importa, en contexto.

CerebroCompuerta talámica

El tálamo filtra las señales sensoriales antes de que lleguen al córtex: amplifica lo relevante y suprime el ruido. La atención no es uniforme; se asigna dinámicamente según las exigencias de la tarea y el contexto previo.

TransformersPesos de autoatención

Cada cabeza de atención calcula una suma ponderada sobre todas las posiciones de la secuencia. Los pesos son aprendidos y dependen del contexto: un token atiende más a unos que a otros según la tarea en curso. El mecanismo es matemáticamente análogo a un filtrado dinámico.

Partner · Enlace de afiliado

Nombre de tu producto

Una o dos frases sobre qué hace este producto y por qué encaja con quien lee este journal. Mantén el tono del texto que lo rodea: se lee mejor y convierte mejor.

Saber más

Las capas como procesamiento jerárquico

Los transformers son profundos: capas apiladas de atención y cálculo feedforward, cada una transformando la representación que produce la capa inferior. Las primeras capas tienden a capturar sintaxis superficial. Las intermedias, semántica. Las últimas, razonamiento abstracto e inferencia propia de la tarea.

Esa especialización por capas no está programada. Emerge del entrenamiento. Y se corresponde con una precisión incómoda con la organización jerárquica del córtex visual, donde V1 detecta bordes, V2 contornos, V4 objetos y el córtex inferotemporal se ocupa del reconocimiento categórico abstracto. La jerarquía no se diseñó en ninguno de los dos sistemas. Ambos la desarrollaron: uno mediante millones de años de selección natural, el otro mediante descenso de gradiente sobre texto.

«Que un modelo entrenado para predecir palabras desarrolle las mismas representaciones jerárquicas que un córtex entrenado para predecir el mundo no es una coincidencia. Es una restricción.»

Ila Fiete, Neurociencia del MIT, parafraseado de una conferencia de 2024

El problema de la memoria

Uno de los paralelismos más llamativos tiene que ver con la memoria. Los transformers tienen una ventana de contexto: una memoria de trabajo finita dentro de la cual debe estar disponible toda la información para que la atención opere. Fuera de esa ventana, la información se pierde salvo que se almacene explícitamente. Es arquitectónicamente parecido a la distinción entre memoria de trabajo y memoria a largo plazo en el cerebro.

El hipocampo consolida las experiencias a corto plazo en almacenamiento duradero durante el sueño. Los transformers no tienen equivalente. Pero quienes estudian cómo guardan conocimiento factual en sus pesos han descubierto que las capas feedforward funcionan como una especie de memoria implícita a largo plazo: codifican hechos en los pesos durante el entrenamiento y los recuperan en la inferencia.

Lo que los paralelismos no significan

Es tentador leer estos paralelismos como prueba de que los transformers son, en algún sentido relevante, cerebrales. No lo son. El cerebro opera con señales electroquímicas, moduladas por decenas de neurotransmisores, en tiempo continuo. Los transformers operan con aritmética de coma flotante, en pasos discretos, sin ninguna dinámica temporal continua.

Cautela Lo que sugieren los paralelismos es algo más interesante y más modesto: que ciertas soluciones computacionales a ciertos problemas quizá sean convergentes. La evolución dio con ellas. El descenso de gradiente dio con ellas. Eso dice algo profundo sobre la geometría del espacio del problema, no sobre la naturaleza de la mente.