En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Cómo hacer que un asistente de inteligencia artificial funcione el doble de rápido en un portátil normal

Intel y Hugging Face han logrado acelerar Qwen3, un modelo de IA capaz de usar herramientas, en ordenadores convencionales sin necesidad de tarjetas gráficas potentes.

Por Redacción2 min
Compartir
Cómo hacer que un asistente de inteligencia artificial funcione el doble de rápido en un portátil normal
Modelos de IA · Hugging Face Blog

Intel y Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) han presentado una técnica que permite ejecutar Qwen3-8B (un modelo de lenguaje creado por Alibaba con capacidad para usar herramientas externas, como buscar información o hacer cálculos) hasta 2,4 veces más rápido en ordenadores portátiles equipados con procesadores Intel Core Ultra. La clave está en un método llamado "especulative decoding" (decodificación especulativa), que utiliza un modelo pequeño y rápido para predecir varias palabras a la vez, mientras el modelo grande solo verifica si esas predicciones son correctas.

El enfoque desarrollado por Intel utiliza draft models (modelos borradores) creados mediante depth pruning (poda por profundidad), una técnica que elimina capas enteras de la red neuronal original para crear versiones mucho más ligeras. En concreto, tomaron el modelo Qwen3-8B completo y generaron tres versiones reducidas —con 4, 8 y 16 capas en lugar de las 28 originales— que ocupan menos memoria y procesan texto mucho más rápido, aunque con menor precisión. Estos modelos reducidos generan propuestas de texto que el modelo completo revisa en paralelo, acelerando todo el proceso sin perder calidad en las respuestas finales.

Según informó Hugging Face en su blog oficial, las pruebas se realizaron en un Dell XPS 14 con procesador Intel Core Ultra 7 258V y 32 GB de RAM, sin GPU dedicada (tarjeta gráfica potente). Utilizaron OpenVINO (un kit de herramientas de Intel para optimizar modelos de IA en sus procesadores) y lograron acelerar la generación de tokens (las unidades mínimas de texto que procesa el modelo) entre 1,7 y 2,4 veces, dependiendo de la combinación de draft model utilizada. La versión con 16 capas ofreció el mejor equilibrio entre velocidad y tasa de aceptación de las predicciones.

Este tipo de optimizaciones son especialmente relevantes para aplicaciones de agentes de IA (programas que pueden realizar tareas complejas combinando varios pasos, como buscar información, hacer cálculos o ejecutar comandos) en dispositivos locales, sin depender de la nube. Intel demostró el sistema ejecutando Qwen3 con ReAct (un framework que permite a los modelos razonar sobre qué herramienta usar en cada momento), logrando que el asistente pudiera resolver consultas del usuario en tiempo real desde el propio ordenador.

La compañía ha publicado los modelos reducidos en Hugging Face para que cualquiera pueda descargarlos y probarlos. Aunque depth pruning ya se usaba en investigación, esta es una de las primeras implementaciones prácticas pensadas para hardware de consumo, sin necesidad de servidores ni tarjetas gráficas caras. La técnica podría generalizarse a otros modelos de lenguaje y arquitecturas, haciendo más accesible el uso de IA avanzada en portátiles convencionales.

Fuente original
Hugging Face Blog
Más en · Modelos de IA