En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Microsoft publica Differential Transformer V2, un modelo de lenguaje más preciso que ignora información irrelevante

La nueva arquitectura mejora la capacidad de los modelos para centrarse en lo importante y reducir el ruido, con resultados competitivos frente a GPT-4 y Claude.

Por Redacción2 min
Compartir
Microsoft publica Differential Transformer V2, un modelo de lenguaje más preciso que ignora información irrelevante
Modelos de IA · Hugging Face Blog

Microsoft ha lanzado Differential Transformer V2, una nueva arquitectura de modelo de lenguaje que mejora la forma en que estos sistemas procesan información. La clave está en un mecanismo llamado "atención diferencial" (una técnica que permite al modelo identificar y centrarse en las partes más relevantes de un texto, ignorando el ruido o la información redundante). Según informó Microsoft en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), esta segunda versión supera a la original en tareas de razonamiento, seguimiento de instrucciones y comprensión lectora.

El problema que intenta resolver es conocido: los modelos de lenguaje tradicionales, basados en la arquitectura Transformer estándar, tienden a prestar atención a demasiadas cosas a la vez, incluyendo patrones poco útiles o repetitivos que ensucian sus predicciones. Differential Transformer V2 resta dos señales de atención para cancelar el ruido y quedarse solo con lo que importa. En la práctica, esto se traduce en respuestas más precisas y coherentes, especialmente en textos largos o complejos.

Microsoft publicó tres versiones del modelo: una pequeña de 1.400 millones de parámetros (los valores internos que el modelo ajusta durante el entrenamiento para aprender patrones en los datos), una mediana de 7.000 millones y una grande de 14.000 millones. Los tres están disponibles con licencia MIT (una licencia de código abierto que permite usarlos, modificarlos y redistribuirlos libremente, incluso en proyectos comerciales) en Hugging Face. En las pruebas de rendimiento, la versión de 14.000 millones obtuvo resultados comparables a GPT-4 en algunos benchmarks (conjuntos de pruebas estandarizadas que se usan para medir las capacidades de los modelos de IA), y superó a modelos de tamaño similar como Llama 3.1 y Qwen.

Además de los pesos del modelo (los parámetros ya entrenados que permiten usar el modelo sin tener que entrenarlo desde cero), Microsoft compartió el código de entrenamiento y un conjunto de datos de 2 billones de tokens (las unidades mínimas de texto que el modelo procesa, equivalentes aproximadamente a palabras o fragmentos de palabras). Esto permite a otros investigadores y empresas replicar el trabajo, adaptarlo a sus necesidades o investigar cómo funciona el mecanismo de atención diferencial en detalle.

La publicación se produce en un momento en que la comunidad de IA de código abierto debate intensamente sobre qué modelos son realmente "abiertos". Differential Transformer V2 cumple con la definición más exigente: modelo, código y datos están disponibles. Aunque su adopción comercial aún está por verse, la arquitectura podría influir en futuros modelos si se confirma que la atención diferencial escala bien a tamaños mayores sin disparar los costes de entrenamiento o inferencia (el proceso de usar un modelo ya entrenado para generar respuestas).

Fuente original
Hugging Face Blog
Más en · Modelos de IA