Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

HELMET: novo teste avalia de verdade se modelos de IA conseguem processar textos longos

Ferramenta da Hugging Face mede se LLMs realmente entendem documentos extensos ou apenas fingem entender, revelando que até os melhores modelos falham em tarefas complexas com muito contexto.

Por Redação2 min
Em resumo

HELMET é uma ferramenta da Hugging Face que testa se LLMs (programas de IA treinados para entender e gerar texto) realmente processam textos longos ou apenas fingem. Ele avalia sete tarefas diferentes, medindo precisão, uso completo do contexto e coerência, revelando que até modelos avançados como GPT-4o e Claude 3.5 Sonnet falham em documentos com mais de 32 mil tokens.

Compartilhar
HELMET: novo teste avalia de verdade se modelos de IA conseguem processar textos longos
Pesquisa · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou o HELMET, uma ferramenta que testa se modelos de linguagem grandes — os LLMs (programas de IA treinados para entender e gerar texto, como o GPT ou o Claude) — realmente conseguem processar textos longos ou apenas parecem conseguir. Segundo informou a empresa em seu blog oficial, os testes atuais não capturam o que acontece quando você pede a um modelo para ler dezenas de páginas e responder perguntas que exigem conectar informações espalhadas pelo documento inteiro.

O HELMET avalia os modelos em sete tarefas diferentes, desde resumir conversas longas até raciocinar sobre dados financeiros complexos, sempre usando contextos de milhares de palavras. A novidade é que ele mede três dimensões ao mesmo tempo: se o modelo acerta a resposta, se ele realmente usou todo o texto fornecido (e não apenas pedaços) e se a resposta faz sentido do começo ao fim. Muitos benchmarks (testes padronizados usados para comparar o desempenho de modelos de IA) anteriores focavam só na precisão, ignorando se o modelo de fato leu tudo ou só adivinhou.

Os resultados mostram que até os modelos mais avançados, como o GPT-4o da OpenAI e o Claude 3.5 Sonnet da Anthropic, têm dificuldades quando o texto ultrapassa 32 mil tokens (unidades básicas de texto que um modelo processa, equivalentes em média a três quartos de uma palavra). Em tarefas que exigem raciocínio lógico sobre documentos longos — como analisar relatórios financeiros de várias páginas —, a taxa de acerto cai drasticamente, mesmo em modelos que anunciam suportar janelas de contexto (a quantidade máxima de texto que um modelo consegue processar de uma vez) de 128 mil tokens ou mais.

A ferramenta é gratuita e já está disponível na plataforma da Hugging Face, permitindo que qualquer pessoa teste modelos novos ou compare diferentes versões. Para quem desenvolve aplicações que dependem de IA para analisar contratos, relatórios médicos ou documentos legais, o HELMET oferece uma forma mais realista de saber se um modelo vai funcionar na prática — e não apenas nos testes de laboratório que os fabricantes costumam divulgar.

Fonte original
Hugging Face Blog
Mais em · Pesquisa