En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Cómo hacer que los modelos de IA sean más baratos sin perder calidad

Un equipo de investigadores ha desarrollado una técnica que reduce hasta 30 veces el coste de entrenar modelos pequeños y eficientes a partir de modelos gigantes.

Por Redacción2 min
Compartir
Cómo hacer que los modelos de IA sean más baratos sin perder calidad
Investigación · Hugging Face Blog

Entrenar modelos de inteligencia artificial desde cero es carísimo: puede costar millones de dólares en servidores y electricidad. Por eso muchas empresas optan por una técnica llamada «destilación de conocimiento» (knowledge distillation), que consiste en usar un modelo grande y potente como «profesor» para entrenar a un modelo más pequeño y barato que funcione casi igual de bien. El problema es que esta técnica, aunque más barata que empezar de cero, sigue siendo muy cara porque requiere generar millones de datos artificiales con el modelo profesor. Ahora, un equipo de Multiverse Computing (una empresa vasca especializada en IA cuántica) ha publicado en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) una forma de hacer este proceso hasta 30 veces más barato.

La técnica tradicional de destilación funciona así: le pides al modelo grande que genere respuestas a miles o millones de preguntas inventadas, y luego entrenas al modelo pequeño para que imite esas respuestas. El cuello de botella está en generar esos datos artificiales, porque cada pregunta y respuesta cuesta dinero en tiempo de computación. Lo que propone Multiverse es seleccionar solo los ejemplos más útiles en lugar de generar millones al azar. Para ello usan algoritmos de muestreo inteligente que priorizan los casos donde el modelo pequeño más necesita aprender, descartando los ejemplos redundantes o demasiado fáciles.

Según los experimentos del equipo, esta selección estratégica permite reducir el número de datos artificiales necesarios entre 10 y 30 veces sin que baje la calidad del modelo destilado. Por ejemplo, si antes necesitabas generar un millón de respuestas con un LLM (Large Language Model, o modelo de lenguaje grande como GPT-4 o Llama), ahora puedes conseguir el mismo resultado con 30.000. Eso significa que una destilación que antes costaba miles de dólares en llamadas a la API (interfaz de programación de aplicaciones, es decir, el servicio que te cobra por usar el modelo) de OpenAI o Anthropic ahora puede costar cientos.

El artículo detalla varios métodos de muestreo que probaron: desde técnicas basadas en incertidumbre (elegir los ejemplos donde el modelo pequeño duda más) hasta enfoques de aprendizaje activo (donde el modelo pide específicamente los casos que le resultan más difíciles). Los mejores resultados los obtuvieron combinando varias estrategias a la vez. El código está disponible en GitHub bajo licencia abierta, lo que permite que cualquier empresa o desarrollador lo use gratis.

Esta mejora importa porque democratiza el acceso a modelos personalizados. Hasta ahora, solo grandes empresas podían permitirse destilar un modelo para su caso de uso específico; con esta técnica, startups y equipos pequeños pueden hacerlo por una fracción del precio. También reduce el impacto ambiental: menos datos generados significa menos energía consumida en los centros de datos donde se ejecutan estos modelos gigantes.

Fuente original
Hugging Face Blog
Más en · Investigación