Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog1 min

Hugging Face lança arena para avaliar modelos de IA que escrevem código

Plataforma testa assistentes de programação executando o código gerado de verdade, não apenas comparando texto

Por Redação1 min
Compartilhar
Hugging Face lança arena para avaliar modelos de IA que escrevem código
Ferramentas · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA) lançou a BigCodeArena, uma nova forma de avaliar quais modelos de inteligência artificial são melhores para escrever código. A diferença está no método: em vez de apenas comparar o texto do código gerado com um gabarito, a arena executa o programa de verdade e verifica se ele funciona.

Segundo informou a Hugging Face em seu blog, a maioria dos rankings atuais de modelos de código usa benchmarks (testes padronizados) que medem apenas se a sintaxe está correta ou se o código se parece com exemplos conhecidos. A BigCodeArena vai além: ela roda o código em um ambiente isolado e checa se ele produz o resultado esperado — uma abordagem chamada de "avaliação ponta a ponta".

A plataforma funciona como uma arena de votação. Dois modelos diferentes (como GPT-4, Claude ou assistentes de código abertos) recebem a mesma tarefa de programação, geram suas soluções, e o sistema executa ambas. Usuários então votam em qual saída preferem, criando um ranking baseado em desempenho real, não em métricas teóricas.

A iniciativa faz parte do projeto BigCode, uma colaboração aberta que já produziu modelos como o StarCoder (um LLM — modelo de linguagem grande — treinado especificamente para programar). A BigCodeArena está disponível publicamente e aceita contribuições da comunidade para expandir o conjunto de tarefas de teste.

Para quem desenvolve ou escolhe ferramentas de IA para programação, a arena oferece uma forma mais confiável de comparar opções: em vez de confiar apenas em números de acurácia, é possível ver qual modelo entrega código que realmente roda sem erros em cenários práticos.

Fonte original
Hugging Face Blog
Mais em · Ferramentas