Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Hugging Face muda forma de avaliar modelos de IA após descobrir que eles decoravam respostas

Plataforma lança novo ranking que testa se os modelos realmente entendem matemática ou apenas repetem padrões memorizados dos testes.

Por Redação2 min
Compartilhar
Hugging Face muda forma de avaliar modelos de IA após descobrir que eles decoravam respostas
Pesquisa · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham e testam modelos de inteligência artificial) anunciou uma reformulação no seu Open LLM Leaderboard, o ranking mais usado para comparar a qualidade de modelos de linguagem de código aberto. O motivo: descobriu-se que muitos modelos estavam "decorando" as respostas dos testes de matemática em vez de realmente resolver os problemas — um fenômeno chamado de contaminação de dados, que acontece quando os exemplos usados nos testes vazam para o material de treinamento dos modelos.

O novo sistema, chamado Math-Verify, funciona de forma diferente. Em vez de apenas checar se a resposta final está certa, ele pede que o modelo mostre o passo a passo da solução e depois verifica se cada etapa faz sentido matematicamente. É como a diferença entre um aluno que decora a resposta do gabarito e outro que realmente sabe fazer a conta. Segundo a Hugging Face, essa abordagem revelou que vários modelos que ocupavam o topo do ranking antigo na verdade tinham um desempenho bem mais fraco quando testados de verdade.

A mudança afeta principalmente os benchmarks de matemática (conjuntos padronizados de testes usados para medir a capacidade dos modelos), como o GSM8K e o MATH. Esses testes são amplamente usados pela indústria para comparar modelos, mas se tornaram tão populares que muitos desenvolvedores passaram a incluir problemas similares nos dados de treinamento — às vezes sem querer, às vezes de propósito. O resultado é que os modelos aprendem a reconhecer o padrão das perguntas, não a raciocinar.

O Math-Verify usa uma técnica chamada verificação formal: depois que o modelo gera uma solução, um programa separado analisa cada linha de raciocínio para confirmar que as operações matemáticas estão corretas. Isso torna muito mais difícil para um modelo "colar" — ele precisa de fato entender a lógica por trás do problema. A Hugging Face informou que o novo leaderboard já está no ar e que planeja expandir esse tipo de verificação para outras áreas além da matemática, como raciocínio lógico e programação.

A iniciativa é importante porque o Open LLM Leaderboard se tornou referência para quem desenvolve ou escolhe modelos de IA de pesos abertos (modelos cujos parâmetros internos podem ser baixados e modificados livremente, ao contrário de sistemas fechados como o GPT-4). Com a correção, a expectativa é que o ranking volte a refletir a capacidade real dos modelos, ajudando desenvolvedores e empresas a tomar decisões mais informadas sobre qual tecnologia usar.

Fonte original
Hugging Face Blog
Mais em · Pesquisa