Intel presenta AutoRound, su sistema para comprimir modelos de IA sin perder calidad
La herramienta de código abierto permite reducir hasta cuatro veces el tamaño de modelos de lenguaje e imagen, haciéndolos más rápidos y accesibles sin sacrificar precisión en las respuestas.
AutoRound es una herramienta de código abierto de Intel que comprime modelos de inteligencia artificial mediante cuantización (reducir el espacio de cada número en memoria). Puede reducir modelos de 16 a 4 bits, haciéndolos cuatro veces más pequeños sin perder precisión, lo que permite ejecutarlos en ordenadores convencionales sin depender de la nube.

Intel ha lanzado AutoRound, una herramienta de código abierto diseñada para comprimir modelos de inteligencia artificial de gran tamaño, según anunció la compañía en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). La tecnología utiliza un proceso llamado cuantización (una técnica que reduce el espacio que ocupa cada número en la memoria del ordenador) para hacer que los modelos ocupen hasta cuatro veces menos sin perder capacidad de respuesta.
La novedad de AutoRound está en su método: en lugar de simplemente redondear números, ajusta los datos del modelo mediante un proceso iterativo que minimiza los errores. Esto permite comprimir tanto LLMs o modelos de lenguaje (sistemas de IA entrenados para entender y generar texto, como GPT o Llama) como VLMs o modelos de visión-lenguaje (que procesan tanto imágenes como texto). La herramienta puede reducir modelos de 16 bits a 4 bits manteniendo un rendimiento comparable al original.
Intel ha probado AutoRound con docenas de modelos populares, incluyendo Llama 3.1, Qwen 2.5 y Phi-3.5, logrando resultados superiores a otras técnicas de compresión existentes en benchmarks estándar (pruebas diseñadas para medir la calidad de las respuestas de un modelo). La compañía ofrece más de 100 modelos ya cuantizados listos para descargar desde Hugging Face, además del código fuente de la herramienta.
Esta tecnología resulta especialmente útil para ejecutar modelos de IA en dispositivos con recursos limitados, como ordenadores personales o servidores pequeños, sin depender de la nube. AutoRound es compatible con hardware de Intel, incluidas sus GPUs integradas (los chips gráficos que vienen en muchos procesadores) y su línea Gaudi para centros de datos, aunque también funciona con equipos de otros fabricantes. Los desarrolladores pueden integrar la herramienta en sus proyectos a través de bibliotecas populares como Transformers de Hugging Face.


