
OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA
Un análisis interno revela problemas en SWE-Bench Pro, una prueba ampliamente usada para evaluar si los modelos de lenguaje pueden resolver bugs reales de código.


















