Cómo funcionan los modelos de IA que activan solo las neuronas necesarias para cada tarea
Los Mixture of Experts permiten crear modelos enormes que consumen pocos recursos al usar solo una parte de su capacidad en cada momento.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) publicó una guía técnica sobre Mixture of Experts o MoE (una arquitectura de red neuronal que divide el modelo en módulos especializados llamados "expertos"). A diferencia de los modelos tradicionales, donde todas las neuronas se activan con cada entrada de datos, los MoE tienen un mecanismo de enrutamiento que decide qué expertos usar para cada tarea concreta. Esto permite construir modelos con billones de parámetros (los valores numéricos que definen el comportamiento de una red neuronal) que en la práctica consumen muchos menos recursos que un modelo denso del mismo tamaño.
La clave está en el "gating network" (una red secundaria que funciona como un controlador de tráfico decidiendo qué expertos activar). Para cada entrada, este mecanismo selecciona solo dos o tres expertos de entre decenas disponibles, manteniendo inactivo el resto. El resultado es que el modelo puede ser técnicamente enorme pero comportarse como uno mucho más pequeño durante la inferencia (el proceso de generar respuestas una vez el modelo ya está entrenado). Mixtral 8x7B, uno de los MoE de código abierto más populares, tiene 47 mil millones de parámetros pero solo activa 13 mil millones en cada predicción.
Sin embargo, los MoE presentan desafíos propios. El entrenamiento es más complejo porque el sistema debe aprender simultáneamente las especializaciones de cada experto y el criterio de enrutamiento óptimo. Además, aunque usan menos cómputo durante la inferencia, requieren que todos los parámetros estén cargados en memoria RAM o VRAM (la memoria de las tarjetas gráficas), lo que puede ser problemático en hardware con memoria limitada. También existe el riesgo de que algunos expertos queden infrautilizados mientras otros se sobrecargan, un problema conocido como "load balancing" que requiere técnicas específicas de regularización durante el entrenamiento.
Según Hugging Face, los MoE están ganando tracción en modelos multimodales (sistemas que procesan texto, imagen, audio y video simultáneamente) porque permiten asignar expertos especializados a cada tipo de dato sin multiplicar el costo computacional. La arquitectura también facilita el fine-tuning eficiente (el proceso de adaptar un modelo general a una tarea específica): en lugar de reentrenar todo el modelo, se pueden ajustar solo los expertos relevantes para el caso de uso. Compañías como Mistral AI y DeepSeek han apostado fuerte por esta arquitectura en sus modelos más recientes de pesos abiertos (modelos cuyo código y parámetros están disponibles públicamente).


