En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Cómo hacer que un asistente de inteligencia artificial funcione el doble de rápido en un portátil normal

Intel y Hugging Face han logrado acelerar Qwen3, un modelo de IA capaz de usar herramientas, en ordenadores convencionales sin necesidad de tarjetas gráficas potentes.

Por Redacción2 min
Compartir
Cómo hacer que un asistente de inteligencia artificial funcione el doble de rápido en un portátil normal
Modelos de IA · Hugging Face Blog

Intel y Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) han presentado una técnica que permite ejecutar Qwen3-8B (un modelo de lenguaje creado por Alibaba con capacidad para usar herramientas externas, como buscar información o hacer cálculos) hasta 2,4 veces más rápido en ordenadores portátiles equipados con procesadores Intel Core Ultra. La clave está en un método llamado "especulative decoding" (decodificación especulativa), que utiliza un modelo pequeño y rápido para predecir varias palabras a la vez, mientras el modelo grande solo verifica si esas predicciones son correctas.

El enfoque desarrollado por Intel utiliza draft models (modelos borradores) creados mediante depth pruning (poda por profundidad), una técnica que elimina capas enteras de la red neuronal original para crear versiones mucho más ligeras. En concreto, tomaron el modelo Qwen3-8B completo y generaron tres versiones reducidas —con 4, 8 y 16 capas en lugar de las 28 originales— que ocupan menos memoria y procesan texto mucho más rápido, aunque con menor precisión. Estos modelos reducidos generan propuestas de texto que el modelo completo revisa en paralelo, acelerando todo el proceso sin perder calidad en las respuestas finales.

Según informó Hugging Face en su blog oficial, las pruebas se realizaron en un Dell XPS 14 con procesador Intel Core Ultra 7 258V y 32 GB de RAM, sin GPU dedicada (tarjeta gráfica potente). Utilizaron OpenVINO (un kit de herramientas de Intel para optimizar modelos de IA en sus procesadores) y lograron acelerar la generación de tokens (las unidades mínimas de texto que procesa el modelo) entre 1,7 y 2,4 veces, dependiendo de la combinación de draft model utilizada. La versión con 16 capas ofreció el mejor equilibrio entre velocidad y tasa de aceptación de las predicciones.

Este tipo de optimizaciones son especialmente relevantes para aplicaciones de agentes de IA (programas que pueden realizar tareas complejas combinando varios pasos, como buscar información, hacer cálculos o ejecutar comandos) en dispositivos locales, sin depender de la nube. Intel demostró el sistema ejecutando Qwen3 con ReAct (un framework que permite a los modelos razonar sobre qué herramienta usar en cada momento), logrando que el asistente pudiera resolver consultas del usuario en tiempo real desde el propio ordenador.

La compañía ha publicado los modelos reducidos en Hugging Face para que cualquiera pueda descargarlos y probarlos. Aunque depth pruning ya se usaba en investigación, esta es una de las primeras implementaciones prácticas pensadas para hardware de consumo, sin necesidad de servidores ni tarjetas gráficas caras. La técnica podría generalizarse a otros modelos de lenguaje y arquitecturas, haciendo más accesible el uso de IA avanzada en portátiles convencionales.

Fuente original
Hugging Face Blog
Más en · Modelos de IA