Richard Sutton cree que los datos sintéticos son «un gran error» para entrenar inteligencia artificial
El pionero de la IA rechaza usar simulaciones para escalar modelos de lenguaje y apuesta por agentes que aprendan continuamente de la realidad.
Richard Sutton, pionero en aprendizaje por refuerzo (técnica que permite a una IA aprender por prueba y error), afirma que usar datos sintéticos (información creada artificialmente por otras IA) para entrenar modelos de lenguaje grandes o LLM es un error, porque cualquier simulación es diminuta frente a la complejidad infinita del mundo real.

Richard Sutton, ganador del Premio Turing (el equivalente al Nobel en informática) y una de las figuras más influyentes en aprendizaje por refuerzo (la técnica que permite a una IA aprender por prueba y error, como cuando enseñas trucos a un perro), ha calificado los datos sintéticos como «un gran error» para el desarrollo de modelos de lenguaje grandes o LLM (sistemas de IA capaces de generar y entender texto, como ChatGPT). Según informó The Decoder, Sutton argumenta que el mundo real es infinitamente complejo y cualquier simulación o dato generado artificialmente resulta «microscópico» en comparación.
El debate surge porque muchas empresas de IA están recurriendo a datos sintéticos —información creada por otros modelos de IA en lugar de extraída del mundo real— para seguir entrenando sus sistemas sin depender de más textos, imágenes o vídeos humanos. La idea es sortear la escasez de contenido nuevo y acelerar el entrenamiento, pero Sutton ve en ello un límite fundamental: el conocimiento humano actúa como cuello de botella, porque cualquier dato sintético deriva de lo que ya sabemos y simula solo una fracción diminuta de la realidad.
Para Sutton, la solución no pasa por entrenar modelos más grandes con más datos artificiales, sino por crear agentes de IA (programas capaces de actuar y tomar decisiones por su cuenta) que aprendan de forma continua a partir de su propia experiencia en el mundo real, sin quedarse congelados tras una fase de entrenamiento. Este enfoque, heredero del aprendizaje por refuerzo, contrasta con la estrategia dominante hoy: entrenar un modelo una sola vez con cantidades masivas de datos y luego desplegarlo sin que siga aprendiendo.
La crítica de Sutton cuestiona uno de los pilares del actual boom de los LLM y plantea un dilema estratégico para la industria. Si tiene razón, intentar escalar modelos mediante simulaciones cada vez más elaboradas sería como intentar aprender a nadar leyendo manuales: útil hasta cierto punto, pero nunca equivalente a tirarse al agua. La pregunta es si las empresas —que han invertido miles de millones en infraestructura para entrenar modelos gigantes— están dispuestas a cambiar de rumbo.


