Google lança T5Gemma, nova família de modelos de IA com arquitetura encoder-decoder
A coleção T5Gemma traz modelos de linguagem com uma estrutura diferente da maioria dos LLMs atuais, prometendo melhor desempenho em tarefas como tradução e resumo de textos.
O Google DeepMind lançou o T5Gemma, uma coleção de modelos de linguagem de grande escala (LLMs, sistemas de IA que entendem e geram texto) com arquitetura encoder-decoder (estrutura em que o modelo processa toda a entrada antes de gerar resposta), mais eficiente para tradução e resumo que os modelos comuns.

O Google DeepMind (a divisão de inteligência artificial do Google) anunciou o lançamento do T5Gemma, uma nova coleção de modelos de linguagem de grande escala (LLMs, os sistemas de IA que entendem e geram texto) com uma arquitetura chamada encoder-decoder (um tipo de estrutura em que o modelo primeiro processa a informação de entrada de forma completa antes de gerar a resposta, diferente dos modelos mais comuns que geram texto palavra por palavra).
A maioria dos LLMs populares hoje, como o GPT da OpenAI ou o próprio Gemini do Google, usa uma arquitetura chamada decoder-only (que gera texto prevendo a próxima palavra com base apenas nas anteriores). O T5Gemma recupera a abordagem encoder-decoder, considerada mais eficiente para tarefas específicas como tradução automática, resumo de documentos longos e resposta a perguntas com base em contextos extensos.
Os modelos T5Gemma herdam características da família Gemma, linha de modelos de pesos abertos (modelos cujos parâmetros internos podem ser baixados e usados livremente por desenvolvedores) que o Google vem desenvolvendo como alternativa mais acessível aos seus sistemas proprietários. A arquitetura T5 (sigla para Text-to-Text Transfer Transformer, um framework criado pelo Google em 2019) trata todas as tarefas de linguagem natural como problemas de conversão de texto em texto.
Segundo o Google, a nova coleção está disponível para download e uso por pesquisadores e desenvolvedores, mantendo a proposta de democratizar o acesso a tecnologias de IA avançadas. A empresa não divulgou os tamanhos específicos dos modelos nem detalhes sobre os dados usados no treinamento, informações que costumam ser importantes para avaliar capacidade e custos de operação de um LLM.


