Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

IBM cria teste para agentes de IA que simula problemas reais de fábrica

AssetOpsBench é um novo benchmark que avalia se agentes de IA conseguem diagnosticar falhas em equipamentos industriais, não apenas responder perguntas genéricas.

Por Redação2 min
Compartilhar
IBM cria teste para agentes de IA que simula problemas reais de fábrica
Pesquisa · Hugging Face Blog

A IBM Research lançou o AssetOpsBench, um benchmark (conjunto de testes padronizados para medir desempenho) que avalia agentes de IA em cenários industriais realistas. A novidade está no foco: em vez de medir se um modelo consegue responder perguntas sobre capital da França ou resolver equações matemáticas, o teste coloca o agente para diagnosticar falhas em turbinas eólicas, bombas de água e outros equipamentos que existem de verdade em fábricas e usinas. O objetivo é descobrir se essas ferramentas funcionam fora do laboratório, onde erros custam dinheiro e segurança.

O benchmark vem acompanhado de um playground interativo hospedado no Hugging Face (uma plataforma onde desenvolvedores compartilham e testam modelos de IA abertos). Qualquer pessoa pode acessar, escolher um agente — como o GPT-4o da OpenAI, o Claude da Anthropic ou modelos menores de código aberto — e observar como ele se sai ao receber dados de sensores, logs de manutenção e manuais técnicos. O sistema simula um ambiente industrial: o agente precisa consultar históricos, interpretar gráficos de temperatura ou vibração e sugerir ações, tudo em tempo real.

Segundo os pesquisadores da IBM, a maioria dos benchmarks existentes avalia apenas conhecimento genérico ou raciocínio abstrato, o que não reflete os desafios de operar equipamentos físicos. No AssetOpsBench, o agente precisa lidar com dados desestruturados (relatórios escritos à mão, tabelas mal formatadas) e tomar decisões que envolvem custo, risco e incerteza — algo comum na indústria, mas raro em testes tradicionais de IA. O projeto é de código aberto, permitindo que empresas adaptem os cenários para seus próprios equipamentos.

A iniciativa chega em um momento em que agentes de IA (sistemas que não apenas respondem, mas executam tarefas e tomam decisões de forma autônoma) começam a ser testados em setores como manufatura, energia e logística. A IBM já usa variantes desse tipo de sistema internamente para prever falhas em data centers. Com o AssetOpsBench público, a empresa quer criar um padrão comum para medir se essas tecnologias estão prontas para ambientes onde um diagnóstico errado pode parar uma linha de produção ou causar acidentes.

Fonte original
Hugging Face Blog
Mais em · Pesquisa