En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

EVA: cómo medir si un asistente de voz con IA realmente funciona

ServiceNow presenta un sistema de evaluación para agentes de voz con inteligencia artificial que va más allá de medir aciertos y errores.

Por Redacción2 min
Compartir
EVA: cómo medir si un asistente de voz con IA realmente funciona
Investigación · Hugging Face Blog

Los asistentes de voz con inteligencia artificial —esos sistemas que permiten hablar con un chatbot como si fuera una persona— están proliferando en servicios de atención al cliente, aplicaciones de salud y asistentes virtuales. Pero medir si funcionan bien es más complejo que comprobar si entendieron una pregunta: hay que valorar si suenan naturales, si manejan interrupciones, si detectan frustraciones o si tardan demasiado en responder. Hasta ahora no existía una forma sistemática de hacer esa evaluación.

Según informó Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), investigadores de ServiceNow han publicado EVA, un framework (un conjunto de herramientas y criterios estandarizados) diseñado específicamente para evaluar agentes de voz conversacionales. El sistema mide diez dimensiones: precisión en las respuestas, naturalidad del tono, capacidad de recuperarse de errores, manejo de interrupciones y silencios, latencia (tiempo que tarda en responder), coherencia en conversaciones largas, detección de emociones del usuario, y cumplimiento de tareas complejas que requieren varios pasos.

La propuesta incluye tres datasets (conjuntos de datos de prueba) con miles de conversaciones sintéticas que cubren escenarios reales: preguntas ambiguas, usuarios frustrados, contextos con ruido de fondo, cambios de tema abruptos. Los modelos se evalúan tanto con métricas automáticas —como WER (tasa de errores en la transcripción de palabras)— como con valoraciones humanas que juzgan si la conversación se sintió fluida o robótica. ServiceNow publicó también un benchmark (tabla comparativa) con el rendimiento de varios modelos populares de voz sobre estos criterios.

El marco es de código abierto y está disponible en Hugging Face, lo que permitirá a equipos de desarrollo comparar distintos modelos o versiones de un mismo agente antes de ponerlo en producción. Según los autores, la intención es establecer un estándar común para que la industria no mida la calidad de estos sistemas solo por si entienden bien las palabras, sino por si ofrecen una experiencia conversacional útil y humana. La evaluación incluye también aspectos de seguridad, como detectar si el agente revela información sensible o sigue instrucciones inapropiadas del usuario.

Fuente original
Hugging Face Blog
Más en · Investigación