Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

IBM cria teste para agentes de IA que simula problemas reais de fábrica

AssetOpsBench é um novo benchmark que avalia se agentes de IA conseguem diagnosticar falhas em equipamentos industriais, não apenas responder perguntas genéricas.

Por Redação2 min
Compartilhar
IBM cria teste para agentes de IA que simula problemas reais de fábrica
Pesquisa · Hugging Face Blog

A IBM Research lançou o AssetOpsBench, um benchmark (conjunto de testes padronizados para medir desempenho) que avalia agentes de IA em cenários industriais realistas. A novidade está no foco: em vez de medir se um modelo consegue responder perguntas sobre capital da França ou resolver equações matemáticas, o teste coloca o agente para diagnosticar falhas em turbinas eólicas, bombas de água e outros equipamentos que existem de verdade em fábricas e usinas. O objetivo é descobrir se essas ferramentas funcionam fora do laboratório, onde erros custam dinheiro e segurança.

O benchmark vem acompanhado de um playground interativo hospedado no Hugging Face (uma plataforma onde desenvolvedores compartilham e testam modelos de IA abertos). Qualquer pessoa pode acessar, escolher um agente — como o GPT-4o da OpenAI, o Claude da Anthropic ou modelos menores de código aberto — e observar como ele se sai ao receber dados de sensores, logs de manutenção e manuais técnicos. O sistema simula um ambiente industrial: o agente precisa consultar históricos, interpretar gráficos de temperatura ou vibração e sugerir ações, tudo em tempo real.

Segundo os pesquisadores da IBM, a maioria dos benchmarks existentes avalia apenas conhecimento genérico ou raciocínio abstrato, o que não reflete os desafios de operar equipamentos físicos. No AssetOpsBench, o agente precisa lidar com dados desestruturados (relatórios escritos à mão, tabelas mal formatadas) e tomar decisões que envolvem custo, risco e incerteza — algo comum na indústria, mas raro em testes tradicionais de IA. O projeto é de código aberto, permitindo que empresas adaptem os cenários para seus próprios equipamentos.

A iniciativa chega em um momento em que agentes de IA (sistemas que não apenas respondem, mas executam tarefas e tomam decisões de forma autônoma) começam a ser testados em setores como manufatura, energia e logística. A IBM já usa variantes desse tipo de sistema internamente para prever falhas em data centers. Com o AssetOpsBench público, a empresa quer criar um padrão comum para medir se essas tecnologias estão prontas para ambientes onde um diagnóstico errado pode parar uma linha de produção ou causar acidentes.

Fonte original
Hugging Face Blog
Mais em · Pesquisa