En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

BigCodeArena: un nuevo sistema para evaluar si el código generado por IA realmente funciona

Hugging Face lanza una plataforma que ejecuta el código producido por modelos de lenguaje para medir su utilidad real, más allá de tests sintéticos.

Por Redacción2 min
Compartir
BigCodeArena: un nuevo sistema para evaluar si el código generado por IA realmente funciona
Herramientas · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de presentar BigCodeArena, un sistema diseñado para evaluar modelos de generación de código de forma más realista. A diferencia de los benchmarks tradicionales (pruebas estandarizadas que miden el rendimiento de un modelo), que comprueban si el código se parece a una solución esperada, BigCodeArena ejecuta el código generado y verifica si funciona correctamente en tareas reales.

Según explica el equipo de BigCode en su blog, los métodos actuales de evaluación tienen limitaciones importantes: muchos tests se basan en problemas demasiado simples o en comparar sintaxis (la forma en que está escrito el código) sin comprobar si el programa hace lo que debería. BigCodeArena, en cambio, toma solicitudes de código del mundo real, genera soluciones con distintos modelos y las ejecuta en un entorno controlado para medir si producen el resultado correcto, si son eficientes y si manejan bien los errores.

La plataforma incluye un conjunto de tareas variadas: desde scripts de análisis de datos hasta funciones de procesamiento de texto, todas extraídas de casos de uso reales documentados en repositorios públicos. Cada modelo —ya sean LLMs comerciales (modelos de lenguaje grande como GPT-4) o de pesos abiertos (modelos cuyo código y parámetros están disponibles públicamente para descarga)— recibe la misma tarea y su respuesta se ejecuta automáticamente. Los resultados se publican en una tabla de clasificación pública que cualquiera puede consultar.

El proyecto es colaborativo: desarrolladores y empresas pueden enviar sus propios modelos para que sean evaluados, y la comunidad puede proponer nuevas tareas de evaluación. BigCodeArena no solo mide qué modelo genera código sintácticamente correcto, sino cuál produce soluciones que realmente sirven en producción (en entornos de trabajo reales). Para Hugging Face, esta aproximación representa un paso hacia evaluaciones más honestas de las capacidades de los modelos de código, alejándose de métricas que pueden inflarse fácilmente sin reflejar utilidad práctica.

Fuente original
Hugging Face Blog
Más en · Herramientas