Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos
O AstaBrief 8B gera resumos citados de literatura acadêmica 3,5 vezes mais rápido que modelos proprietários e pode rodar em servidores próprios de universidades
O Allen Institute liberou o AstaBrief 8B, um modelo de linguagem aberto treinado para transformar perguntas de pesquisa e trechos de artigos em relatórios científicos citados. Ele gera um relatório em 51 segundos em média (3,5 vezes mais rápido que o modo baseado no Claude, um LLM da Anthropic), pode ser baixado e rodado em servidores próprios de universidades, e está disponível junto com os dados de treino para reprodução e adaptação.

O Allen Institute for AI (Ai2, instituto de pesquisa sem fins lucrativos sediado em Seattle) liberou o AstaBrief 8B, um modelo de linguagem treinado especificamente para transformar perguntas de pesquisa e trechos de artigos científicos em relatórios citados. O modelo está disponível para download gratuito, junto com os dados usados no treinamento, e já funciona como opção rápida dentro do Asta, a plataforma do instituto para trabalho científico com IA. Segundo a equipe, o AstaBrief gera um relatório completo em média em 51 segundos, contra 178 segundos do modo baseado no Claude (um LLM, ou large language model, isto é, modelo de linguagem de grande escala, da Anthropic) — uma redução de cerca de 70% no tempo.
A decisão de criar um modelo menor e aberto veio da observação de como cientistas realmente usam ferramentas de IA. Em vez de buscas simples por palavras-chave, os pesquisadores que usam o Asta costumam trazer contexto denso e várias restrições — por exemplo, pedindo para comparar abordagens em um conjunto de estudos levando em conta um método, população ou contexto específico. Muitos também voltam aos relatórios gerados depois, tratando-os como rascunhos de trabalho em vez de respostas descartáveis. O problema é que modelos proprietários são caros de rodar e não podem ser instalados dentro de universidades ou laboratórios, o que impede seu uso quando a pergunta revela trabalho sensível ou ainda não publicado.
O AstaBrief partiu do Qwen3-8B (um modelo de base criado pela empresa chinesa Alibaba) e foi refinado com 47 mil exemplos de relatórios gerados a partir de 90 mil perguntas reais feitas por usuários do Asta. A equipe filtrou essas perguntas para remover tráfego de teste, consultas curtas demais e pedidos que não eram sobre ciência, depois usou uma mistura de modelos proprietários (Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT-4.1) para gerar relatórios-alvo que serviram de treino. Em vez de usar métodos de aprendizado por reforço (RL, que envolvem um modelo aprendendo por tentativa e erro com recompensas), a equipe optou por supervised fine-tuning (SFT, ajuste fino supervisionado, onde o modelo aprende a partir de exemplos corretos) e direct preference optimization (DPO, otimização direta de preferência, onde o modelo aprende a partir de pares de respostas boas e ruins) — uma receita mais simples, barata e fácil de debugar.
A grande mudança de arquitetura foi treinar o modelo para escrever o relatório inteiro de uma vez, em vez de construí-lo seção por seção como faz o modo Claude do Asta. Isso eliminou etapas caras de resumir e agrupar trechos de literatura antes de escrever, e a equipe relata que não houve perda de qualidade. O modelo também foi treinado para manter as citações grudadas nas afirmações — um requisito central do trabalho científico, onde é preciso conseguir verificar cada claim (afirmação) voltando à fonte original. O instituto disponibilizou ainda um workflow (fluxo de trabalho) de exemplo para que pesquisadores possam adaptar o AstaBrief e gerar relatórios a partir de seus próprios PDFs rodando tudo localmente, sem enviar dados para fora.
O trabalho com o AstaBrief faz parte de uma investigação maior do Ai2 sobre como adaptar modelos de linguagem para necessidades científicas, incluindo o NSF OMAI (uma iniciativa nacional dos Estados Unidos para construir infraestrutura de IA totalmente aberta para descoberta científica). A equipe observa que as necessidades variam bastante entre áreas e fluxos de trabalho — alguns pesquisadores querem IA para ideação ou experimentação, outros preferem um papel mais estreito em síntese, vigilância de literatura ou identificação de padrões — mas em todos os casos há demanda por rastreabilidade de fontes, mais visibilidade sobre o que o modelo está fazendo e maior controle sobre o contexto que ele usa. A avaliação descrita no post foi concluída no início de 2025 e não foi refeita contra os modelos de fronteira mais recentes, então os resultados devem ser lidos como evidência sobre as escolhas de treino e design de sistema que foram testadas naquele momento.


