Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Hugging Face passa a exibir resultados de benchmarks independentes direto nas páginas dos modelos de IA

A plataforma integrou dados do projeto Every Eval Ever para mostrar como cada modelo se sai em testes criados pela comunidade, não apenas pelas empresas que os desenvolvem.

Por Redação2 min
Compartilhar
Hugging Face passa a exibir resultados de benchmarks independentes direto nas páginas dos modelos de IA
Modelos de IA · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou que vai começar a exibir resultados de avaliações independentes direto nas páginas de cada modelo. A novidade usa dados do Every Eval Ever, um projeto que reúne benchmarks (testes padronizados que medem a qualidade de um modelo de IA) criados pela comunidade, e não apenas pelas empresas que desenvolvem os modelos.

Até agora, quem queria comparar modelos de linguagem (LLMs, os sistemas de IA que entendem e geram texto, como o ChatGPT) dependia principalmente de tabelas de classificação oficiais ou de testes feitos pelas próprias empresas — o que levanta dúvidas sobre viés. Com a integração do Every Eval Ever, qualquer pessoa pode ver como um modelo se saiu em dezenas de testes diferentes, muitos deles focados em tarefas específicas ou criados por pesquisadores independentes.

Na prática, quando você acessar a página de um modelo na Hugging Face, vai encontrar uma nova aba com os resultados desses benchmarks comunitários. A ideia é dar mais transparência: em vez de confiar apenas no que a empresa desenvolvedora diz, você pode ver como o modelo performa em avaliações feitas por terceiros, que testam desde raciocínio lógico até conhecimento específico de áreas como medicina ou direito.

O Every Eval Ever funciona como um agregador: ele coleta resultados de benchmarks publicados em papers acadêmicos, repositórios no GitHub e outras fontes abertas, e os organiza em um formato que qualquer pessoa pode consultar. Segundo a Hugging Face, a integração já está disponível e deve crescer conforme mais avaliações forem adicionadas ao projeto.

A mudança reflete uma tendência maior no setor: com a multiplicação de modelos de IA nos últimos meses, cresce a demanda por formas confiáveis de compará-los. Benchmarks independentes ajudam tanto quem escolhe um modelo para usar em um projeto quanto quem quer entender melhor as limitações reais de cada sistema — algo que nem sempre fica claro nos materiais de divulgação oficiais.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA