Microsoft lança nova versão de arquitetura que promete tornar modelos de IA mais precisos com menos memória
O Differential Transformer V2 melhora a capacidade dos modelos de linguagem de filtrar informação irrelevante e pode reduzir o custo de rodar IA em até 62%.

A Microsoft lançou uma atualização da arquitetura Differential Transformer (um tipo de estrutura que organiza como modelos de linguagem processam texto), que promete deixar modelos de inteligência artificial mais precisos sem aumentar — e até reduzindo — a quantidade de memória e poder de processamento necessários. Segundo informou a empresa em artigo publicado no blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), a nova versão consegue melhorar a capacidade dos modelos de distinguir informação importante de ruído, um dos grandes problemas atuais dos LLMs (sigla em inglês para modelos de linguagem de grande escala, como o ChatGPT).
A principal inovação está em como o modelo calcula a atenção — o mecanismo que decide quais partes de um texto merecem mais foco ao gerar uma resposta. A versão anterior do Differential Transformer já fazia isso de forma dupla, subtraindo uma camada de atenção "ruidosa" de outra mais relevante. A V2 melhora esse processo e adiciona um recurso chamado Multi-Head Differential Attention (uma forma de processar várias perspectivas do texto ao mesmo tempo, cada uma filtrando ruído de maneira independente), o que torna o modelo mais eficiente e preciso.
Na prática, a Microsoft conseguiu resultados expressivos: em tarefas de recuperação de informação (quando o modelo precisa encontrar dados específicos em textos longos), a nova arquitetura alcançou 97,4% de precisão, contra 51,9% de modelos tradicionais baseados na arquitetura Transformer padrão. Além disso, o Differential Transformer V2 consegue manter 62% menos informação armazenada em cache (memória temporária usada durante o processamento) sem perder desempenho, o que reduz drasticamente o custo de rodar esses modelos em servidores.
A arquitetura já está disponível de forma aberta na biblioteca Transformers da Hugging Face e pode ser treinada ou adaptada por qualquer desenvolvedor. A Microsoft também liberou modelos pré-treinados com 1,4 bilhão e 7 bilhões de parâmetros (os "pesos" que determinam o comportamento do modelo) para que pesquisadores e empresas possam testar a tecnologia. A expectativa é que a nova abordagem seja adotada em aplicações que exigem processar contextos muito longos — como análise de contratos, sumarização de documentos extensos ou assistentes que precisam lembrar de conversas inteiras — onde modelos atuais costumam se perder ou misturar informações irrelevantes.


