Cómo hacer que un asistente de inteligencia artificial funcione el doble de rápido en un portátil normal
Intel y Hugging Face han logrado acelerar Qwen3, un modelo de IA capaz de usar herramientas, en ordenadores convencionales sin necesidad de tarjetas gráficas potentes.

Intel y Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) han presentado una técnica que permite ejecutar Qwen3-8B (un modelo de lenguaje creado por Alibaba con capacidad para usar herramientas externas, como buscar información o hacer cálculos) hasta 2,4 veces más rápido en ordenadores portátiles equipados con procesadores Intel Core Ultra. La clave está en un método llamado "especulative decoding" (decodificación especulativa), que utiliza un modelo pequeño y rápido para predecir varias palabras a la vez, mientras el modelo grande solo verifica si esas predicciones son correctas.
El enfoque desarrollado por Intel utiliza draft models (modelos borradores) creados mediante depth pruning (poda por profundidad), una técnica que elimina capas enteras de la red neuronal original para crear versiones mucho más ligeras. En concreto, tomaron el modelo Qwen3-8B completo y generaron tres versiones reducidas —con 4, 8 y 16 capas en lugar de las 28 originales— que ocupan menos memoria y procesan texto mucho más rápido, aunque con menor precisión. Estos modelos reducidos generan propuestas de texto que el modelo completo revisa en paralelo, acelerando todo el proceso sin perder calidad en las respuestas finales.
Según informó Hugging Face en su blog oficial, las pruebas se realizaron en un Dell XPS 14 con procesador Intel Core Ultra 7 258V y 32 GB de RAM, sin GPU dedicada (tarjeta gráfica potente). Utilizaron OpenVINO (un kit de herramientas de Intel para optimizar modelos de IA en sus procesadores) y lograron acelerar la generación de tokens (las unidades mínimas de texto que procesa el modelo) entre 1,7 y 2,4 veces, dependiendo de la combinación de draft model utilizada. La versión con 16 capas ofreció el mejor equilibrio entre velocidad y tasa de aceptación de las predicciones.
Este tipo de optimizaciones son especialmente relevantes para aplicaciones de agentes de IA (programas que pueden realizar tareas complejas combinando varios pasos, como buscar información, hacer cálculos o ejecutar comandos) en dispositivos locales, sin depender de la nube. Intel demostró el sistema ejecutando Qwen3 con ReAct (un framework que permite a los modelos razonar sobre qué herramienta usar en cada momento), logrando que el asistente pudiera resolver consultas del usuario en tiempo real desde el propio ordenador.
La compañía ha publicado los modelos reducidos en Hugging Face para que cualquiera pueda descargarlos y probarlos. Aunque depth pruning ya se usaba en investigación, esta es una de las primeras implementaciones prácticas pensadas para hardware de consumo, sin necesidad de servidores ni tarjetas gráficas caras. La técnica podría generalizarse a otros modelos de lenguaje y arquitecturas, haciendo más accesible el uso de IA avanzada en portátiles convencionales.


