Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Hugging Face lança OpenEnv para padronizar testes de agentes de IA

Plataforma open source quer resolver o caos de benchmarks incompatíveis e criar um ecossistema comum para avaliar agentes autônomos.

Por Redação2 min
Compartilhar
Hugging Face lança OpenEnv para padronizar testes de agentes de IA
Ferramentas · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou nesta semana o OpenEnv, uma iniciativa open source (código aberto) para padronizar a forma como a indústria testa agentes de IA — sistemas autônomos capazes de executar tarefas complexas, como navegar em sites, rodar código ou interagir com ferramentas. Segundo a empresa, o projeto nasce da constatação de que o setor está fragmentado: cada laboratório ou pesquisador cria seus próprios benchmarks (conjuntos de testes para medir desempenho), o que torna impossível comparar resultados de forma justa ou reproduzir experimentos.

O OpenEnv funciona como uma camada unificadora sobre ambientes de teste já existentes — como WebArena (simulação de navegação na web), SWE-bench (tarefas de programação) e OSWorld (interação com sistemas operacionais). A ideia é que qualquer agente, independentemente de como foi construído, possa ser testado nos mesmos cenários, com a mesma infraestrutura e métricas padronizadas. A plataforma já suporta integração com frameworks populares como LangGraph e AutoGen, e está sendo desenvolvida em parceria com Carnegie Mellon, Stanford e empresas como Cognition AI.

Na prática, o OpenEnv resolve dois problemas: evita que cada equipe precise recriar do zero a infraestrutura de testes (economizando tempo e recursos computacionais) e permite que pesquisadores publiquem resultados que outros consigam reproduzir — algo raro hoje em dia, segundo a Hugging Face. A plataforma também inclui ferramentas para rodar testes em nuvem de forma escalável, com suporte para diferentes tipos de hardware e modelos de linguagem (LLMs, os sistemas de IA que entendem e geram texto).

O lançamento acontece em um momento em que agentes de IA deixam de ser experimentos acadêmicos e começam a aparecer em produtos reais — de assistentes que agendam reuniões a sistemas que debugam código automaticamente. Mas sem padrões comuns, fica difícil saber se um agente é realmente melhor que outro ou se apenas foi testado em cenários mais fáceis. O OpenEnv é totalmente aberto e está disponível no GitHub, com documentação voltada tanto para quem quer testar agentes quanto para quem quer adicionar novos ambientes de avaliação ao projeto.

Fonte original
Hugging Face Blog
Mais em · Ferramentas