Como a IBM treinou os novos modelos Granite 4.2 para rodar em qualquer lugar
A IBM explica em detalhes como criou seus modelos de linguagem de código aberto, projetados para funcionar tanto em data centers quanto em computadores comuns
A IBM lançou a família Granite 4.2, modelos de linguagem de IA (programas que entendem e geram texto) com pesos abertos, disponíveis em versões de 1 a 8 bilhões de parâmetros. Foram treinados com 12 trilhões de tokens em 12 idiomas e 116 linguagens de programação, projetados para funcionar tanto em data centers quanto em dispositivos pequenos.

A IBM publicou um artigo técnico explicando como construiu a nova família Granite 4.2, modelos de linguagem de inteligência artificial (programas que entendem e geram texto) com pesos abertos (ou seja, qualquer pessoa pode baixar e usar livremente). A empresa treinou três versões principais — com 1 bilhão, 3 bilhões e 8 bilhões de parâmetros (números que representam o tamanho e a capacidade do modelo) — e oferece ainda versões menores, otimizadas para rodar em celulares e computadores sem placa de vídeo potente.
O diferencial dos Granite 4.2 está na estratégia de treinamento. A IBM usou um conjunto de dados com 12 trilhões de tokens (unidades de texto que o modelo processa, equivalentes a palavras ou pedaços de palavras) vindos de 12 idiomas e 116 linguagens de programação. Em vez de treinar apenas um modelo gigante, a equipe criou versões de tamanhos diferentes desde o início, cada uma otimizada para um tipo de uso: os modelos maiores rodam em servidores e data centers, enquanto os menores funcionam até em dispositivos como o Jetson Nano (um computador pequeno e barato feito para rodar modelos de IA sem depender da internet).
Depois do treinamento inicial, a IBM aplicou uma etapa de ajuste fino (fine-tuning, processo em que o modelo é retreinado com exemplos específicos para melhorar seu desempenho em tarefas como responder perguntas ou escrever código). Os modelos passaram ainda por RLHF (Reinforcement Learning from Human Feedback, técnica em que humanos avaliam as respostas do modelo para ensiná-lo a gerar textos mais úteis e seguros). Segundo a IBM, os Granite 4.2 competem com modelos proprietários (aqueles que só podem ser usados mediante pagamento ou licença restrita) em testes de compreensão de texto, matemática e programação.
A empresa disponibilizou os modelos na Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) sob licença Apache 2.0, que permite uso comercial sem restrições. A IBM também publicou os dados de treinamento e o código usado para treinar os modelos, algo raro entre grandes empresas de tecnologia. A expectativa da companhia é que desenvolvedores usem os Granite 4.2 tanto para criar aplicações em nuvem quanto para produtos que rodam diretamente no dispositivo do usuário, sem enviar dados para servidores externos — uma demanda crescente em áreas como saúde e finanças, onde a privacidade é crítica.


