En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

MiniMax redefine cómo entrenar modelos de IA para que funcionen en el mundo real

La empresa china presenta un enfoque que hace que los agentes de inteligencia artificial generalicen mejor más allá de los entornos de entrenamiento.

Por Redacción2 min
Compartir
MiniMax redefine cómo entrenar modelos de IA para que funcionen en el mundo real
Investigación · Hugging Face Blog

MiniMax, una empresa china especializada en inteligencia artificial, acaba de publicar en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) los detalles técnicos de M2, su modelo de agente de IA. El artículo plantea una pregunta incómoda: ¿tiene sentido seguir entrenando agentes con benchmarks (pruebas estandarizadas) que no se parecen en nada a las tareas que tendrán que resolver después?

El problema, según explican, es que los agentes de IA actuales aprenden a completar tareas muy específicas en entornos controlados, pero luego fallan estrepitosamente cuando se enfrentan a situaciones ligeramente distintas. MiniMax propone un cambio: en lugar de alinear el modelo (ajustarlo mediante entrenamiento adicional) solo para que apruebe tests predefinidos, lo alinean para que entienda mejor qué está intentando hacer el usuario en cada momento, incluso si nunca vio exactamente esa tarea antes.

Para lograrlo, combinan varios métodos. Primero, entrenan el modelo base con datos sintéticos generados por otro LLM (modelo de lenguaje de gran tamaño, como los que usan ChatGPT o Claude) que simula instrucciones del mundo real. Después, aplican fine-tuning (ajuste fino, un reentrenamiento con ejemplos específicos) usando tanto datos reales de usuarios como ejemplos diseñados a mano por expertos. Finalmente, usan reinforcement learning (aprendizaje por refuerzo, donde el modelo aprende a través de prueba y error con recompensas) para que el agente mejore su capacidad de generalizar.

Los resultados, publicados por MiniMax, muestran que M2 supera a modelos como GPT-4o y Claude 3.5 Sonnet en benchmarks que miden la capacidad de completar tareas prácticas con herramientas digitales, como navegar por páginas web o usar aplicaciones. La clave, insisten, no es memorizar más ejemplos, sino entrenar al modelo para que entienda la estructura subyacente de cualquier tarea nueva.

El artículo incluye ablation studies (experimentos donde se retiran componentes del sistema para medir su impacto individual) que demuestran que cada pieza del proceso aporta mejoras significativas. MiniMax no ha liberado el modelo completo todavía, pero promete hacerlo pronto, lo que podría dar a otros equipos acceso a un enfoque más robusto para construir agentes que funcionen fuera del laboratorio.

Fuente original
Hugging Face Blog
Más en · Investigación