IBM logra que los modelos de IA piensen más rápido usando menos datos
Investigadores de IBM han presentado ALTK-Evolve, un método que reduce a la mitad el tiempo de entrenamiento de modelos que razonan paso a paso, como el reciente DeepSeek-R1.

Los modelos de inteligencia artificial que razonan paso a paso —como DeepSeek-R1 (un modelo chino que resuelve problemas mostrando su proceso de pensamiento) o el sistema o1 de OpenAI— han demostrado que "pensar más despacio" puede mejorar sus respuestas. Pero ese razonamiento explícito tiene un coste: generan muchas más palabras (llamadas tokens) durante su entrenamiento, lo que multiplica el tiempo y los recursos necesarios para entrenarlos. Investigadores de IBM Research y la Universidad de Illinois acaban de presentar una solución llamada ALTK-Evolve que reduce ese coste a la mitad.
El problema está en cómo se entrenan estos modelos. Para que aprendan a razonar, se les suele mostrar ejemplos con cadenas de pensamiento (CoT, chain-of-thought en inglés: secuencias donde el modelo explica su razonamiento antes de dar una respuesta). Generar esas cadenas largas durante el entrenamiento es lento y caro. ALTK-Evolve propone una idea simple pero efectiva: en lugar de procesar la cadena completa de razonamiento en cada paso, el modelo aprende a comprimir esa información en "tokens de pensamiento" especiales que resumen el razonamiento intermedio.
Según publica IBM en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), su método funciona en dos fases. Primero, el modelo aprende a destilar (comprimir) su razonamiento largo en esos tokens especiales mediante un proceso llamado SLDD (Streamlined Latent Distillation and Differentiation). Después, esos tokens comprimidos se usan durante el entrenamiento normal, reduciendo drásticamente la cantidad de datos que el modelo necesita procesar. En pruebas con el modelo Llama-3.1-8B (un modelo de código abierto de Meta con 8.000 millones de parámetros), lograron reducir el tiempo de entrenamiento un 50% sin perder precisión en tareas de razonamiento matemático y lógico.
El equipo de IBM también probó si esos tokens de pensamiento aprendidos en un modelo podían reutilizarse en otros modelos de la misma familia (una técnica llamada transferencia de conocimiento). Los resultados fueron mixtos: funcionó bien entre modelos similares, pero perdió efectividad cuando se intentó aplicar a arquitecturas diferentes, lo que sugiere que estos tokens están muy ligados a la estructura interna de cada modelo.
La investigación llega en un momento clave. Desde que DeepSeek demostró que un modelo chino podía competir con GPT-4 (el modelo de lenguaje más avanzado de OpenAI) a una fracción del coste, la industria busca formas de hacer el entrenamiento de modelos más eficiente. ALTK-Evolve no solo acelera el proceso: también abre la puerta a que modelos más pequeños puedan aprender a razonar sin necesitar los recursos de los grandes laboratorios. Los investigadores ya han publicado el código y los modelos en Hugging Face para que otros equipos puedan reproducir y mejorar el método.


