Gemma 4 llega a los asistentes de voz en tiempo real gracias a Hugging Face y Cerebras
La colaboración permite ejecutar el modelo de Google en aplicaciones conversacionales sin retardos perceptibles, un desafío técnico hasta ahora reservado a sistemas propietarios.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) y Cerebras (una empresa especializada en chips optimizados para ejecutar redes neuronales) han anunciado que han adaptado Gemma 4, el modelo de lenguaje abierto de Google, para funcionar en asistentes de voz en tiempo real. Esto significa que el modelo puede generar respuestas conversacionales sin pausas incómodas, algo que hasta ahora era terreno casi exclusivo de sistemas cerrados como el de OpenAI o Google Assistant.
El secreto está en los procesadores WSE-3 de Cerebras, que aceleran la inferencia (el proceso de generar respuestas una vez el modelo ya está entrenado) hasta el punto de que la latencia —el tiempo que tarda en empezar a hablar— se vuelve imperceptible para el oído humano. Según la demostración publicada, Gemma 4 puede mantener conversaciones fluidas incluso cuando se le interrumpe, un test difícil para la mayoría de modelos abiertos que suelen necesitar más tiempo de procesamiento.
Para los desarrolladores, esto abre la puerta a crear asistentes de voz personalizados sin depender de las API de pago de las grandes tecnológicas. Al tratarse de un modelo de pesos abiertos (esto es, cuyos parámetros internos se pueden descargar y modificar libremente), cualquiera puede adaptarlo a idiomas minoritarios, jergas específicas o casos de uso nicho que los modelos comerciales no cubren bien.
La alianza también pone de relieve la importancia del hardware especializado en IA: no basta con tener un buen modelo si no puedes ejecutarlo lo bastante rápido. Cerebras ha apostado por chips gigantes, del tamaño de una oblea de silicio completa, frente a las GPU tradicionales de Nvidia, una estrategia arriesgada que empieza a dar frutos en escenarios donde la velocidad de respuesta es crítica. Hugging Face, por su parte, sigue consolidándose como el GitHub de la inteligencia artificial, el lugar donde las innovaciones abiertas se ponen a disposición de la comunidad.


