Durante años, la industria de la IA operó sobre una fe simple: haz el modelo más grande, entrénalo con más datos y será más inteligente. El artículo de OpenAI sobre leyes de escalado, en 2020, le dio a esa fe un esqueleto matemático. Ahora, con los rendimientos decrecientes asomando, los investigadores se preguntan qué viene después de la escala.
El artículo se titulaba «Scaling Laws for Neural Language Models». Lo publicó en enero de 2020 un equipo de OpenAI. Su hallazgo central suena casi banal: el rendimiento del modelo mejora de forma predecible al aumentar su tamaño, el del conjunto de datos y el cómputo. La pérdida sigue una ley de potencias. La relación es suave, fiable y —lo decisivo— no parece aplanarse.
Las implicaciones eran enormes. Si escalar mejoraba el rendimiento de manera fiable, el camino hacia una IA mejor estaba claro: gastar más, computar más, escalar más. Sin necesidad de avances algorítmicos. Sin arquitecturas nuevas. Solo más. El artículo no describió el desarrollo de la IA: se convirtió en un documento estratégico que orientó decisiones de inversión de miles de millones.
Qué decían realmente las leyes
El artículo de 2020 halló que el rendimiento —medido como pérdida sobre texto reservado— escalaba como una ley de potencias en tres magnitudes: el número de parámetros del modelo (N), el tamaño del conjunto de entrenamiento (D) y el presupuesto total de cómputo (C). Duplique cualquiera de ellas y obtendrá una mejora predecible. Las leyes se sostuvieron a lo largo de varios órdenes de magnitud.
Lo esencial: el artículo halló que esas tres magnitudes podían intercambiarse entre sí, pero no en igualdad de condiciones. Para un presupuesto de cómputo fijo existía una asignación óptima entre tamaño del modelo y volumen de datos. El artículo original sugería que el tamaño del modelo era el factor dominante. Resultó ser falso.
Nombre de tu producto
Una o dos frases sobre qué hace este producto y por qué encaja con quien lee este journal. Mantén el tono del texto que lo rodea: se lee mejor y convierte mejor.
Saber más →La corrección Chinchilla
En 2022, DeepMind publicó «Training Compute-Optimal Large Language Models», el artículo que presentó Chinchilla. Su hallazgo era llamativo: GPT-3, con 175.000 millones de parámetros, estaba gravemente subentrenado. La estrategia óptima para un presupuesto de cómputo dado era usar un modelo más pequeño entrenado con muchísimos más datos.
Chinchilla —70.000 millones de parámetros, entrenado con 1,4 billones de tokens— superó a GPT-3 en casi todas las pruebas usando bastante menos cómputo. Las leyes de escalado revisadas sugerían que la proporción entre tokens de entrenamiento y parámetros debía rondar el 20:1. Casi ningún modelo existente se acercaba.
Implicación La carrera por construir el modelo más grande partía de un mal calibrado. El campo llevaba tiempo gastando recursos enormes en la dirección equivocada. Chinchilla forzó una recalibración y planteó una pregunta incómoda: si los datos importan tanto, ¿qué ocurre cuando se agoten los datos de calidad?
Puede que nos acerquemos al punto en que internet ya se haya consumido. Después de eso, las leyes de escalado se convierten en un problema de otra naturaleza.
— Ilya Sutskever, en una conferencia del sector, 2024El muro de datos
El límite más apremiante a corto plazo son los datos. Las estimaciones apuntan a unos 10 billones de tokens de texto de alta calidad disponibles en internet. Al ritmo de entrenamiento de los modelos frontera actuales, el campo podría agotar esa reserva en pocos años. ¿Y después?
Hay varias respuestas sobre la mesa. Los datos sintéticos —usar IA para generar datos de entrenamiento para la IA— han pasado de idea marginal a estrategia dominante. Modelos como GPT-4 y Claude se emplean ya para generar enormes cantidades de ejemplos sintéticos, cadenas de razonamiento y pares de pregunta y respuesta curados. La duda es si los datos sintéticos introducen desplazamientos de distribución sutiles que limiten la generalización.
La curación y el filtrado por calidad se han convertido en un área de investigación propia. FineWeb, un conjunto de datos reciente de Hugging Face, demostró que filtrar con cuidado los datos de Common Crawl podía superar con holgura a conjuntos mayores y peor curados. La calidad, resulta, importa tanto como la cantidad. Quizá más.
Qué viene después de la escala
La investigación más interesante de 2025 y 2026 se ha centrado en lo que el campo llama «postentrenamiento»: el conjunto de técnicas aplicadas tras la fase inicial de preentrenamiento. Aprendizaje por refuerzo con retroalimentación humana, IA constitucional, cadenas de razonamiento sintéticas, cómputo en tiempo de inferencia. Estos enfoques han producido mejoras espectaculares sin escalar en absoluto el modelo base.
La era del escalado ingenuo —modelo más grande, más datos, mejores resultados— se ha terminado. Lo que la sustituye es más complejo, más diverso y, se puede defender, más interesante. Las restricciones que impuso el escalado obligaron al campo a afinar qué estaba intentando hacer en realidad.
Las leyes de escalado nos dieron un mapa. Sus límites nos están dando algo más valioso: una razón para pensar mejor sobre el destino.