Microsoft publica Differential Transformer V2, un modelo de lenguaje más preciso que ignora información irrelevante
La nueva arquitectura mejora la capacidad de los modelos para centrarse en lo importante y reducir el ruido, con resultados competitivos frente a GPT-4 y Claude.

Microsoft ha lanzado Differential Transformer V2, una nueva arquitectura de modelo de lenguaje que mejora la forma en que estos sistemas procesan información. La clave está en un mecanismo llamado "atención diferencial" (una técnica que permite al modelo identificar y centrarse en las partes más relevantes de un texto, ignorando el ruido o la información redundante). Según informó Microsoft en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), esta segunda versión supera a la original en tareas de razonamiento, seguimiento de instrucciones y comprensión lectora.
El problema que intenta resolver es conocido: los modelos de lenguaje tradicionales, basados en la arquitectura Transformer estándar, tienden a prestar atención a demasiadas cosas a la vez, incluyendo patrones poco útiles o repetitivos que ensucian sus predicciones. Differential Transformer V2 resta dos señales de atención para cancelar el ruido y quedarse solo con lo que importa. En la práctica, esto se traduce en respuestas más precisas y coherentes, especialmente en textos largos o complejos.
Microsoft publicó tres versiones del modelo: una pequeña de 1.400 millones de parámetros (los valores internos que el modelo ajusta durante el entrenamiento para aprender patrones en los datos), una mediana de 7.000 millones y una grande de 14.000 millones. Los tres están disponibles con licencia MIT (una licencia de código abierto que permite usarlos, modificarlos y redistribuirlos libremente, incluso en proyectos comerciales) en Hugging Face. En las pruebas de rendimiento, la versión de 14.000 millones obtuvo resultados comparables a GPT-4 en algunos benchmarks (conjuntos de pruebas estandarizadas que se usan para medir las capacidades de los modelos de IA), y superó a modelos de tamaño similar como Llama 3.1 y Qwen.
Además de los pesos del modelo (los parámetros ya entrenados que permiten usar el modelo sin tener que entrenarlo desde cero), Microsoft compartió el código de entrenamiento y un conjunto de datos de 2 billones de tokens (las unidades mínimas de texto que el modelo procesa, equivalentes aproximadamente a palabras o fragmentos de palabras). Esto permite a otros investigadores y empresas replicar el trabajo, adaptarlo a sus necesidades o investigar cómo funciona el mecanismo de atención diferencial en detalle.
La publicación se produce en un momento en que la comunidad de IA de código abierto debate intensamente sobre qué modelos son realmente "abiertos". Differential Transformer V2 cumple con la definición más exigente: modelo, código y datos están disponibles. Aunque su adopción comercial aún está por verse, la arquitectura podría influir en futuros modelos si se confirma que la atención diferencial escala bien a tamaños mayores sin disparar los costes de entrenamiento o inferencia (el proceso de usar un modelo ya entrenado para generar respuestas).


