Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Microsoft lança nova versão de arquitetura que promete tornar modelos de IA mais precisos com menos memória

O Differential Transformer V2 melhora a capacidade dos modelos de linguagem de filtrar informação irrelevante e pode reduzir o custo de rodar IA em até 62%.

Por Redação2 min
Compartilhar
Microsoft lança nova versão de arquitetura que promete tornar modelos de IA mais precisos com menos memória
Pesquisa · Hugging Face Blog

A Microsoft lançou uma atualização da arquitetura Differential Transformer (um tipo de estrutura que organiza como modelos de linguagem processam texto), que promete deixar modelos de inteligência artificial mais precisos sem aumentar — e até reduzindo — a quantidade de memória e poder de processamento necessários. Segundo informou a empresa em artigo publicado no blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), a nova versão consegue melhorar a capacidade dos modelos de distinguir informação importante de ruído, um dos grandes problemas atuais dos LLMs (sigla em inglês para modelos de linguagem de grande escala, como o ChatGPT).

A principal inovação está em como o modelo calcula a atenção — o mecanismo que decide quais partes de um texto merecem mais foco ao gerar uma resposta. A versão anterior do Differential Transformer já fazia isso de forma dupla, subtraindo uma camada de atenção "ruidosa" de outra mais relevante. A V2 melhora esse processo e adiciona um recurso chamado Multi-Head Differential Attention (uma forma de processar várias perspectivas do texto ao mesmo tempo, cada uma filtrando ruído de maneira independente), o que torna o modelo mais eficiente e preciso.

Na prática, a Microsoft conseguiu resultados expressivos: em tarefas de recuperação de informação (quando o modelo precisa encontrar dados específicos em textos longos), a nova arquitetura alcançou 97,4% de precisão, contra 51,9% de modelos tradicionais baseados na arquitetura Transformer padrão. Além disso, o Differential Transformer V2 consegue manter 62% menos informação armazenada em cache (memória temporária usada durante o processamento) sem perder desempenho, o que reduz drasticamente o custo de rodar esses modelos em servidores.

A arquitetura já está disponível de forma aberta na biblioteca Transformers da Hugging Face e pode ser treinada ou adaptada por qualquer desenvolvedor. A Microsoft também liberou modelos pré-treinados com 1,4 bilhão e 7 bilhões de parâmetros (os "pesos" que determinam o comportamento do modelo) para que pesquisadores e empresas possam testar a tecnologia. A expectativa é que a nova abordagem seja adotada em aplicações que exigem processar contextos muito longos — como análise de contratos, sumarização de documentos extensos ou assistentes que precisam lembrar de conversas inteiras — onde modelos atuais costumam se perder ou misturar informações irrelevantes.

Fonte original
Hugging Face Blog
Mais em · Pesquisa