En directo
[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónOpenAI News2 min

OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA

Un análisis interno revela problemas en SWE-Bench Pro, una prueba ampliamente usada para evaluar si los modelos de lenguaje pueden resolver bugs reales de código.

Por Redacción2 min
En resumen

OpenAI detectó errores y ambigüedades en SWE-Bench Pro, un benchmark (prueba estandarizada) muy usado para medir si los modelos de IA saben programar. Según la compañía, algunas soluciones marcadas como correctas no resuelven el problema real, y la variabilidad en los resultados puede deberse a fallos en el propio test.

Compartir
OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA
Investigación · OpenAI News

OpenAI ha publicado un análisis que pone en duda la fiabilidad de SWE-Bench Pro, uno de los test más populares para medir la capacidad de programación de los modelos de inteligencia artificial. Según informó la compañía, este benchmark (una prueba estandarizada que se usa para comparar el rendimiento de distintos modelos) contiene errores y ambigüedades que dificultan saber si un sistema realmente resuelve un problema o simplemente se beneficia de fallos en la propia prueba.

SWE-Bench Pro está diseñado para evaluar si un modelo de IA puede corregir bugs reales extraídos de repositorios de código abierto en GitHub. La idea es que el modelo lea la descripción de un problema, genere un parche (un fragmento de código que soluciona el error) y lo aplique correctamente. Sin embargo, el análisis de OpenAI detectó casos en los que las soluciones marcadas como correctas en realidad no resolvían el problema original, o donde la descripción del bug era tan vaga que resultaba imposible saber qué se esperaba exactamente.

Este tipo de problemas no es nuevo en el mundo de los benchmarks de IA. A medida que los modelos mejoran, las pruebas que antes servían para distinguir entre sistemas buenos y malos empiezan a saturarse (todos los modelos puntúan muy alto) o a revelar defectos de diseño. En el caso de SWE-Bench Pro, OpenAI argumenta que la variabilidad en los resultados puede deberse más a inconsistencias en el propio test que a diferencias reales en la habilidad de los modelos.

La compañía no propone una alternativa concreta, pero su análisis subraya la necesidad de diseñar evaluaciones más rigurosas y transparentes. Para desarrolladores y empresas que usan estos benchmarks para elegir qué modelo integrar en sus productos, la advertencia es clara: una puntuación alta en un test popular no siempre garantiza que el sistema funcione bien en situaciones reales.

Fuente original
OpenAI News
Más en · Investigación