En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Cómo hacer que los modelos de IA sean más baratos sin perder calidad

Un equipo de investigadores ha desarrollado una técnica que reduce hasta 30 veces el coste de entrenar modelos pequeños y eficientes a partir de modelos gigantes.

Por Redacción2 min
Compartir
Cómo hacer que los modelos de IA sean más baratos sin perder calidad
Investigación · Hugging Face Blog

Entrenar modelos de inteligencia artificial desde cero es carísimo: puede costar millones de dólares en servidores y electricidad. Por eso muchas empresas optan por una técnica llamada «destilación de conocimiento» (knowledge distillation), que consiste en usar un modelo grande y potente como «profesor» para entrenar a un modelo más pequeño y barato que funcione casi igual de bien. El problema es que esta técnica, aunque más barata que empezar de cero, sigue siendo muy cara porque requiere generar millones de datos artificiales con el modelo profesor. Ahora, un equipo de Multiverse Computing (una empresa vasca especializada en IA cuántica) ha publicado en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) una forma de hacer este proceso hasta 30 veces más barato.

La técnica tradicional de destilación funciona así: le pides al modelo grande que genere respuestas a miles o millones de preguntas inventadas, y luego entrenas al modelo pequeño para que imite esas respuestas. El cuello de botella está en generar esos datos artificiales, porque cada pregunta y respuesta cuesta dinero en tiempo de computación. Lo que propone Multiverse es seleccionar solo los ejemplos más útiles en lugar de generar millones al azar. Para ello usan algoritmos de muestreo inteligente que priorizan los casos donde el modelo pequeño más necesita aprender, descartando los ejemplos redundantes o demasiado fáciles.

Según los experimentos del equipo, esta selección estratégica permite reducir el número de datos artificiales necesarios entre 10 y 30 veces sin que baje la calidad del modelo destilado. Por ejemplo, si antes necesitabas generar un millón de respuestas con un LLM (Large Language Model, o modelo de lenguaje grande como GPT-4 o Llama), ahora puedes conseguir el mismo resultado con 30.000. Eso significa que una destilación que antes costaba miles de dólares en llamadas a la API (interfaz de programación de aplicaciones, es decir, el servicio que te cobra por usar el modelo) de OpenAI o Anthropic ahora puede costar cientos.

El artículo detalla varios métodos de muestreo que probaron: desde técnicas basadas en incertidumbre (elegir los ejemplos donde el modelo pequeño duda más) hasta enfoques de aprendizaje activo (donde el modelo pide específicamente los casos que le resultan más difíciles). Los mejores resultados los obtuvieron combinando varias estrategias a la vez. El código está disponible en GitHub bajo licencia abierta, lo que permite que cualquier empresa o desarrollador lo use gratis.

Esta mejora importa porque democratiza el acceso a modelos personalizados. Hasta ahora, solo grandes empresas podían permitirse destilar un modelo para su caso de uso específico; con esta técnica, startups y equipos pequeños pueden hacerlo por una fracción del precio. También reduce el impacto ambiental: menos datos generados significa menos energía consumida en los centros de datos donde se ejecutan estos modelos gigantes.

Fuente original
Hugging Face Blog
Más en · Investigación