En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Cómo funcionan los modelos de IA que activan solo las neuronas necesarias para cada tarea

Los Mixture of Experts permiten crear modelos enormes que consumen pocos recursos al usar solo una parte de su capacidad en cada momento.

Por Redacción2 min
Compartir
Cómo funcionan los modelos de IA que activan solo las neuronas necesarias para cada tarea
Investigación · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) publicó una guía técnica sobre Mixture of Experts o MoE (una arquitectura de red neuronal que divide el modelo en módulos especializados llamados "expertos"). A diferencia de los modelos tradicionales, donde todas las neuronas se activan con cada entrada de datos, los MoE tienen un mecanismo de enrutamiento que decide qué expertos usar para cada tarea concreta. Esto permite construir modelos con billones de parámetros (los valores numéricos que definen el comportamiento de una red neuronal) que en la práctica consumen muchos menos recursos que un modelo denso del mismo tamaño.

La clave está en el "gating network" (una red secundaria que funciona como un controlador de tráfico decidiendo qué expertos activar). Para cada entrada, este mecanismo selecciona solo dos o tres expertos de entre decenas disponibles, manteniendo inactivo el resto. El resultado es que el modelo puede ser técnicamente enorme pero comportarse como uno mucho más pequeño durante la inferencia (el proceso de generar respuestas una vez el modelo ya está entrenado). Mixtral 8x7B, uno de los MoE de código abierto más populares, tiene 47 mil millones de parámetros pero solo activa 13 mil millones en cada predicción.

Sin embargo, los MoE presentan desafíos propios. El entrenamiento es más complejo porque el sistema debe aprender simultáneamente las especializaciones de cada experto y el criterio de enrutamiento óptimo. Además, aunque usan menos cómputo durante la inferencia, requieren que todos los parámetros estén cargados en memoria RAM o VRAM (la memoria de las tarjetas gráficas), lo que puede ser problemático en hardware con memoria limitada. También existe el riesgo de que algunos expertos queden infrautilizados mientras otros se sobrecargan, un problema conocido como "load balancing" que requiere técnicas específicas de regularización durante el entrenamiento.

Según Hugging Face, los MoE están ganando tracción en modelos multimodales (sistemas que procesan texto, imagen, audio y video simultáneamente) porque permiten asignar expertos especializados a cada tipo de dato sin multiplicar el costo computacional. La arquitectura también facilita el fine-tuning eficiente (el proceso de adaptar un modelo general a una tarea específica): en lugar de reentrenar todo el modelo, se pueden ajustar solo los expertos relevantes para el caso de uso. Compañías como Mistral AI y DeepSeek han apostado fuerte por esta arquitectura en sus modelos más recientes de pesos abiertos (modelos cuyo código y parámetros están disponibles públicamente).

Fuente original
Hugging Face Blog
Más en · Investigación