En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Cómo funcionan los modelos de IA que activan solo las neuronas necesarias para cada tarea

Los Mixture of Experts permiten crear modelos enormes que consumen pocos recursos al usar solo una parte de su capacidad en cada momento.

Por Redacción2 min
Compartir
Cómo funcionan los modelos de IA que activan solo las neuronas necesarias para cada tarea
Investigación · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) publicó una guía técnica sobre Mixture of Experts o MoE (una arquitectura de red neuronal que divide el modelo en módulos especializados llamados "expertos"). A diferencia de los modelos tradicionales, donde todas las neuronas se activan con cada entrada de datos, los MoE tienen un mecanismo de enrutamiento que decide qué expertos usar para cada tarea concreta. Esto permite construir modelos con billones de parámetros (los valores numéricos que definen el comportamiento de una red neuronal) que en la práctica consumen muchos menos recursos que un modelo denso del mismo tamaño.

La clave está en el "gating network" (una red secundaria que funciona como un controlador de tráfico decidiendo qué expertos activar). Para cada entrada, este mecanismo selecciona solo dos o tres expertos de entre decenas disponibles, manteniendo inactivo el resto. El resultado es que el modelo puede ser técnicamente enorme pero comportarse como uno mucho más pequeño durante la inferencia (el proceso de generar respuestas una vez el modelo ya está entrenado). Mixtral 8x7B, uno de los MoE de código abierto más populares, tiene 47 mil millones de parámetros pero solo activa 13 mil millones en cada predicción.

Sin embargo, los MoE presentan desafíos propios. El entrenamiento es más complejo porque el sistema debe aprender simultáneamente las especializaciones de cada experto y el criterio de enrutamiento óptimo. Además, aunque usan menos cómputo durante la inferencia, requieren que todos los parámetros estén cargados en memoria RAM o VRAM (la memoria de las tarjetas gráficas), lo que puede ser problemático en hardware con memoria limitada. También existe el riesgo de que algunos expertos queden infrautilizados mientras otros se sobrecargan, un problema conocido como "load balancing" que requiere técnicas específicas de regularización durante el entrenamiento.

Según Hugging Face, los MoE están ganando tracción en modelos multimodales (sistemas que procesan texto, imagen, audio y video simultáneamente) porque permiten asignar expertos especializados a cada tipo de dato sin multiplicar el costo computacional. La arquitectura también facilita el fine-tuning eficiente (el proceso de adaptar un modelo general a una tarea específica): en lugar de reentrenar todo el modelo, se pueden ajustar solo los expertos relevantes para el caso de uso. Compañías como Mistral AI y DeepSeek han apostado fuerte por esta arquitectura en sus modelos más recientes de pesos abiertos (modelos cuyo código y parámetros están disponibles públicamente).

Fuente original
Hugging Face Blog
Más en · Investigación