Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog3 min

Seu agente de IA acertou uma vez — mas vai acertar de novo?

Pesquisadores da IBM descobriram que agentes de inteligência artificial podem ter desempenho variável na mesma tarefa e criaram uma ferramenta que reduz pela metade essa instabilidade sem perder precisão

Por Redação3 min
Em resumo

Pesquisadores da IBM criaram o Consistency Analyzer, uma ferramenta que identifica pontos de decisão instáveis em agentes de IA (programas que usam modelos de linguagem para executar tarefas de forma autônoma) e gera diretrizes que reduzem pela metade a variabilidade de desempenho na mesma tarefa, sem comprometer a precisão média

Compartilhar
Seu agente de IA acertou uma vez — mas vai acertar de novo?
Pesquisa · Hugging Face Blog

Um agente de IA (um programa que usa um modelo de linguagem para executar tarefas de forma autônoma, como buscar informações ou preencher formulários) funciona perfeitamente durante os testes, mas falha na demonstração ao vivo. Isso não é só constrangedor — em produção, significa que uma tarefa que deu certo hoje pode falhar amanhã, mesmo que o usuário faça exatamente a mesma solicitação. Para aplicações críticas, como reconciliar transações financeiras ou verificar cláusulas contratuais, essa variabilidade é um problema sério.

A maioria dos benchmarks (conjuntos padronizados de tarefas usados para avaliar desempenho) esconde essa instabilidade atrás de uma média. Segundo informou a equipe de pesquisa da IBM em artigo no blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), um agente ReAct (um tipo de agente que alterna entre raciocinar e agir) usando o GPT-4.1 no benchmark AppWorld acertou 77,4% das tarefas em média ao longo de cinco repetições. Mas ele acertou todas as cinco tentativas em apenas 53,0% das tarefas — uma diferença de consistência de 24,4 pontos percentuais. A maioria dos benchmarks reporta apenas o primeiro número.

O problema está na forma como os modelos de linguagem tomam decisões. Cada vez que um agente escolhe qual API (interface de programação, o meio pelo qual programas conversam entre si) chamar ou que argumento passar, essa decisão sai de uma distribuição de probabilidade sobre os próximos tokens (as unidades mínimas de texto que o modelo processa, geralmente palavras ou partes de palavras). Quando essa distribuição é "afiada" — com quase toda a probabilidade concentrada em uma única opção — a mesma escolha sai toda vez. Quando é "plana" — com várias opções empatadas — pequenas variações numéricas causadas por flutuações na GPU (chip especializado em processar grandes volumes de cálculos em paralelo, essencial para rodar modelos de IA) podem inverter o resultado. Como uma trajetória encadeia dezenas de decisões, uma pequena chance de mudança em cada passo se transforma em grande chance de que alguma execução siga um caminho diferente.

A equipe da IBM desenvolveu o Consistency Analyzer, uma ferramenta de diagnóstico que identifica exatamente esses pontos de decisão instáveis. Dado um único registro de execução passada, o analisador repete cada passo de decisão através de reamostragem controlada — pedindo ao modelo que gere cinco respostas alternativas para aquele ponto específico, sem precisar rodar a tarefa inteira de novo nem ter acesso aos dados de probabilidade internos do modelo. Isso gera uma pontuação de consistência por passo que indica quais decisões correm risco de mudar na próxima execução.

Esses pontos frágeis são então transformados em diretrizes de consistência — instruções em linguagem natural que o sistema ALTK-Evolve (uma ferramenta que transforma execuções passadas de agentes em orientações reutilizáveis) injeta de volta no contexto do agente em tempo de inferência (o momento em que o modelo processa uma nova solicitação e gera uma resposta). Por exemplo, numa tarefa do AppWorld sobre contar itens marcados numa nota, o sistema gerou diretrizes como "use uma busca de padrão ancorada por linha em vez de uma contagem simples de substring" — não porque o agente tenha falhado, mas porque a decisão original foi instável. Os resultados são claros: a taxa de tarefas nas quais o agente acerta todas as cinco tentativas subiu de 53,0% para 69,0%, enquanto a média geral subiu apenas de 77,4% para 81,0% — a diferença de consistência caiu pela metade, de 24,4 para 12,0 pontos percentuais, sem custo em precisão média.

Fonte original
Hugging Face Blog
Mais em · Pesquisa