Hugging Face lança arena para avaliar modelos de IA que escrevem código
Plataforma testa assistentes de programação executando o código gerado de verdade, não apenas comparando texto

A Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA) lançou a BigCodeArena, uma nova forma de avaliar quais modelos de inteligência artificial são melhores para escrever código. A diferença está no método: em vez de apenas comparar o texto do código gerado com um gabarito, a arena executa o programa de verdade e verifica se ele funciona.
Segundo informou a Hugging Face em seu blog, a maioria dos rankings atuais de modelos de código usa benchmarks (testes padronizados) que medem apenas se a sintaxe está correta ou se o código se parece com exemplos conhecidos. A BigCodeArena vai além: ela roda o código em um ambiente isolado e checa se ele produz o resultado esperado — uma abordagem chamada de "avaliação ponta a ponta".
A plataforma funciona como uma arena de votação. Dois modelos diferentes (como GPT-4, Claude ou assistentes de código abertos) recebem a mesma tarefa de programação, geram suas soluções, e o sistema executa ambas. Usuários então votam em qual saída preferem, criando um ranking baseado em desempenho real, não em métricas teóricas.
A iniciativa faz parte do projeto BigCode, uma colaboração aberta que já produziu modelos como o StarCoder (um LLM — modelo de linguagem grande — treinado especificamente para programar). A BigCodeArena está disponível publicamente e aceita contribuições da comunidade para expandir o conjunto de tarefas de teste.
Para quem desenvolve ou escolhe ferramentas de IA para programação, a arena oferece uma forma mais confiável de comparar opções: em vez de confiar apenas em números de acurácia, é possível ver qual modelo entrega código que realmente roda sem erros em cenários práticos.


