En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

EVA: cómo medir si un asistente de voz con IA realmente funciona

ServiceNow presenta un sistema de evaluación para agentes de voz con inteligencia artificial que va más allá de medir aciertos y errores.

Por Redacción2 min
Compartir
EVA: cómo medir si un asistente de voz con IA realmente funciona
Investigación · Hugging Face Blog

Los asistentes de voz con inteligencia artificial —esos sistemas que permiten hablar con un chatbot como si fuera una persona— están proliferando en servicios de atención al cliente, aplicaciones de salud y asistentes virtuales. Pero medir si funcionan bien es más complejo que comprobar si entendieron una pregunta: hay que valorar si suenan naturales, si manejan interrupciones, si detectan frustraciones o si tardan demasiado en responder. Hasta ahora no existía una forma sistemática de hacer esa evaluación.

Según informó Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), investigadores de ServiceNow han publicado EVA, un framework (un conjunto de herramientas y criterios estandarizados) diseñado específicamente para evaluar agentes de voz conversacionales. El sistema mide diez dimensiones: precisión en las respuestas, naturalidad del tono, capacidad de recuperarse de errores, manejo de interrupciones y silencios, latencia (tiempo que tarda en responder), coherencia en conversaciones largas, detección de emociones del usuario, y cumplimiento de tareas complejas que requieren varios pasos.

La propuesta incluye tres datasets (conjuntos de datos de prueba) con miles de conversaciones sintéticas que cubren escenarios reales: preguntas ambiguas, usuarios frustrados, contextos con ruido de fondo, cambios de tema abruptos. Los modelos se evalúan tanto con métricas automáticas —como WER (tasa de errores en la transcripción de palabras)— como con valoraciones humanas que juzgan si la conversación se sintió fluida o robótica. ServiceNow publicó también un benchmark (tabla comparativa) con el rendimiento de varios modelos populares de voz sobre estos criterios.

El marco es de código abierto y está disponible en Hugging Face, lo que permitirá a equipos de desarrollo comparar distintos modelos o versiones de un mismo agente antes de ponerlo en producción. Según los autores, la intención es establecer un estándar común para que la industria no mida la calidad de estos sistemas solo por si entienden bien las palabras, sino por si ofrecen una experiencia conversacional útil y humana. La evaluación incluye también aspectos de seguridad, como detectar si el agente revela información sensible o sigue instrucciones inapropiadas del usuario.

Fuente original
Hugging Face Blog
Más en · Investigación