Un solo modelo de IA capaz de aprender cualquier tipo de dato estadístico
Investigadores del Allen Institute presentan DiScoFormer, un transformer que puede modelar distribuciones de datos muy diferentes sin necesidad de reentrenarse desde cero.

Un equipo del Allen Institute for AI ha publicado DiScoFormer, un modelo basado en transformers (la arquitectura de IA que popularizó ChatGPT) que puede aprender a representar distribuciones estadísticas de datos muy variados sin necesidad de ajustarse de forma específica para cada tarea. La novedad, según informó Hugging Face en su blog oficial, es que el mismo modelo puede calcular tanto la densidad de probabilidad (qué tan probable es un dato concreto) como el score (una métrica que indica en qué dirección aumenta esa probabilidad), dos conceptos fundamentales en modelos generativos de IA.
Hasta ahora, los modelos generativos solían diseñarse para un tipo concreto de dato: imágenes, texto o audio, por ejemplo. DiScoFormer, en cambio, se entrena de forma más general y puede aplicarse a distribuciones estadísticas distintas sin requerir arquitecturas especializadas. Esto lo convierte en una herramienta útil para investigadores que trabajan con datos científicos o experimentales donde no siempre se dispone de grandes volúmenes de ejemplos para entrenar un modelo desde cero.
El modelo utiliza una técnica llamada score matching (un método para entrenar modelos generativos sin necesidad de calcular constantes de normalización, que suelen ser computacionalmente costosas) combinada con la capacidad de los transformers para procesar secuencias de información. Los autores demuestran que DiScoFormer puede modelar distribuciones complejas en dominios donde otros enfoques requieren mucho más ajuste manual o datos de entrenamiento específicos.
El código y los pesos del modelo (los parámetros ya entrenados que permiten usarlo sin repetir el entrenamiento) están disponibles en Hugging Face bajo licencia abierta. Aunque por ahora se trata de una herramienta orientada a la investigación, su flexibilidad podría facilitar el desarrollo de aplicaciones en campos como la biología computacional, la física de partículas o el diseño de moléculas, donde modelar distribuciones de datos complejas es clave pero los conjuntos de datos suelen ser pequeños o muy especializados.


