Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog1 min

Hugging Face lança arena para avaliar modelos de IA que escrevem código

Plataforma testa assistentes de programação executando o código gerado de verdade, não apenas comparando texto

Por Redação1 min
Compartilhar
Hugging Face lança arena para avaliar modelos de IA que escrevem código
Ferramentas · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA) lançou a BigCodeArena, uma nova forma de avaliar quais modelos de inteligência artificial são melhores para escrever código. A diferença está no método: em vez de apenas comparar o texto do código gerado com um gabarito, a arena executa o programa de verdade e verifica se ele funciona.

Segundo informou a Hugging Face em seu blog, a maioria dos rankings atuais de modelos de código usa benchmarks (testes padronizados) que medem apenas se a sintaxe está correta ou se o código se parece com exemplos conhecidos. A BigCodeArena vai além: ela roda o código em um ambiente isolado e checa se ele produz o resultado esperado — uma abordagem chamada de "avaliação ponta a ponta".

A plataforma funciona como uma arena de votação. Dois modelos diferentes (como GPT-4, Claude ou assistentes de código abertos) recebem a mesma tarefa de programação, geram suas soluções, e o sistema executa ambas. Usuários então votam em qual saída preferem, criando um ranking baseado em desempenho real, não em métricas teóricas.

A iniciativa faz parte do projeto BigCode, uma colaboração aberta que já produziu modelos como o StarCoder (um LLM — modelo de linguagem grande — treinado especificamente para programar). A BigCodeArena está disponível publicamente e aceita contribuições da comunidade para expandir o conjunto de tarefas de teste.

Para quem desenvolve ou escolhe ferramentas de IA para programação, a arena oferece uma forma mais confiável de comparar opções: em vez de confiar apenas em números de acurácia, é possível ver qual modelo entrega código que realmente roda sem erros em cenários práticos.

Fonte original
Hugging Face Blog
Mais em · Ferramentas