Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

IBM cria teste que mede se agentes de IA conseguem atualizar código antigo de empresas

O ScarfBench avalia se modelos de linguagem são capazes de migrar aplicações Java legadas para frameworks modernos — uma tarefa que consome meses de trabalho humano.

Por Redação2 min
Compartilhar
IBM cria teste que mede se agentes de IA conseguem atualizar código antigo de empresas
Pesquisa · Hugging Face Blog

A IBM Research lançou o ScarfBench, um benchmark (conjunto de testes padronizados para comparar desempenho) que mede a capacidade de agentes de IA em migrar código Java antigo para versões mais modernas. Segundo informou a equipe no blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), o teste simula uma tarefa real que consome meses de trabalho em grandes empresas: atualizar aplicações construídas em frameworks desatualizados, como o Java EE (uma plataforma empresarial para construir sistemas web), para tecnologias como o Quarkus (um framework Java moderno e mais rápido, feito para rodar em nuvem).

O benchmark inclui 30 repositórios reais de código aberto, totalizando mais de 1,8 milhão de linhas de código. Os agentes de IA precisam não apenas reescrever trechos isolados, mas navegar por múltiplos arquivos, entender dependências entre componentes e aplicar padrões de migração documentados — tudo sem supervisão humana. A IBM testou modelos como GPT-4o (da OpenAI), Claude 3.5 Sonnet (da Anthropic, uma empresa de IA fundada por ex-funcionários da OpenAI) e Llama 3.1 (um modelo de pesos abertos da Meta, ou seja, cujo código interno pode ser inspecionado e modificado), entre outros.

Os resultados mostram que nenhum modelo atual resolve o problema sozinho. O melhor desempenho foi do GPT-4o, que conseguiu migrar corretamente apenas 3% dos repositórios de ponta a ponta. Modelos menores, como o Llama 3.1 de 8 bilhões de parâmetros (números que definem o "tamanho" e a capacidade de um modelo de IA), tiveram desempenho ainda mais limitado. A IBM destaca que a dificuldade não está apenas em gerar código, mas em manter a coerência em projetos grandes e aplicar regras de migração que mudam conforme o contexto.

Para empresas, isso importa porque boa parte da infraestrutura crítica do mundo ainda roda em Java — bancos, seguradoras, sistemas de logística. Migrar essas aplicações manualmente é caro e arriscado: um erro pode derrubar um sistema em produção. Se agentes de IA conseguirem automatizar parte desse trabalho, mesmo que ainda precisem de revisão humana, o ganho de tempo e a redução de custos seriam enormes. O ScarfBench está disponível publicamente e a IBM espera que outros pesquisadores usem o teste para melhorar os modelos.

A equipe também liberou os dados de avaliação, scripts de teste e exemplos de saída dos modelos no repositório do projeto. A ideia é que o benchmark vire uma referência para medir progresso nessa área específica — migrações de código empresarial —, que até agora não tinha um padrão de comparação. Segundo a IBM, o próximo passo é investigar técnicas como RAG (Retrieval-Augmented Generation, um método que permite ao modelo buscar informações externas antes de gerar uma resposta) e fine-tuning (ajuste fino, quando um modelo é retreinado com dados específicos para melhorar seu desempenho em uma tarefa) para melhorar os resultados.

Fonte original
Hugging Face Blog
Mais em · Pesquisa