Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis

UK AISI passa a publicar resultados de avaliações de modelos de linguagem usando a plataforma EvalEval, que padroniza como esses testes são documentados e compartilhados.

Por Redação2 min
Em resumo

O UK AISI (instituto britânico de segurança em IA, ligado ao governo do Reino Unido) adotou a plataforma EvalEval para publicar resultados de testes com modelos de linguagem. A EvalEval criou um formato padrão (Every Eval Ever) que documenta como os experimentos foram feitos, permitindo que outros pesquisadores verifiquem e repitam os mesmos testes de forma confiável.

Compartilhar
Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis
Pesquisa · Hugging Face Blog

O instituto britânico de segurança em inteligência artificial (UK AISI, vinculado ao governo do Reino Unido) começou a usar a plataforma EvalEval para publicar os resultados de seus testes com modelos de linguagem de grande porte (LLMs, os sistemas de IA que entendem e geram texto, como o ChatGPT). A mudança busca tornar esses resultados reproduzíveis — ou seja, permitir que outros pesquisadores possam verificar e repetir os mesmos testes, algo difícil hoje porque cada laboratório documenta seus experimentos de um jeito diferente.

A EvalEval é uma coalização de pesquisadores que criou um formato padrão, chamado Every Eval Ever, para registrar como os testes foram feitos, quais modelos foram usados e em que condições. Junto com isso, mantém uma plataforma chamada Evaluation Cards (cartões de avaliação), onde resultados de diferentes laboratórios ficam disponíveis num formato comparável. O UK AISI agora publica seus dados lá, incluindo testes recentes com seis modelos de ponta — Claude Opus 4, 4.5 e 4.6 (da Anthropic) e GPT-5, 5.2 e 5.4 (da OpenAI) — em cinco benchmarks (conjuntos de tarefas usados para medir o desempenho de um modelo), entre eles o FrontierMath e o Humanity's Last Exam.

Segundo a EvalEval, a falta de padronização é um problema sério: resultados são publicados em formatos diferentes, muitas vezes sem informação suficiente para entender como foram obtidos, e refazer os testes costuma ser caro demais. Com a adoção do sistema por parte do UK AISI, outros pesquisadores passam a ter pontos de referência verificados para comparar com seus próprios experimentos — por exemplo, para descobrir se diferenças nos resultados vêm do modelo em si ou da forma como o teste foi conduzido.

Os dados publicados pelo instituto britânico acompanham um artigo que mostra como o desempenho dos modelos muda conforme a quantidade de processamento usada durante o teste e o tipo de protocolo adotado (por exemplo, se o modelo recebe ou não feedback de que errou antes de tentar de novo). A EvalEval agora convida outros desenvolvedores de modelos e criadores de benchmarks a adotar o mesmo formato, com o objetivo de criar um repositório aberto e confiável de resultados de avaliações de IA.

Fonte original
Hugging Face Blog
Mais em · Pesquisa