Como treinar modelos de IA menores sem gastar uma fortuna
Empresa propõe técnica que reduz em até 75% o custo de destilação de conhecimento, processo usado para criar versões mais leves de grandes modelos de linguagem.

A Multiverse Computing, empresa espanhola especializada em IA para finanças, apresentou um método que pode tornar a criação de modelos de linguagem compactos bem mais barata. A técnica melhora um processo chamado de destilação de conhecimento (knowledge distillation) — uma forma de treinar um modelo pequeno para imitar o comportamento de um modelo maior, sem precisar começar do zero. Segundo a empresa, o novo método reduz em até 75% os custos computacionais desse processo, o que pode permitir que mais equipes criem modelos próprios sem depender exclusivamente de serviços pagos na nuvem.
O artigo, publicado no blog oficial da Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), explica que o segredo está em uma abordagem chamada de "destilação de conhecimento agnóstica ao modelo". Na prática, isso significa que o método funciona sem precisar acessar os pesos internos do modelo maior — ou seja, é possível destilar conhecimento de qualquer LLM (large language model, os modelos gigantes que entendem e geram texto) acessível por API, incluindo modelos fechados como o GPT-4 da OpenAI ou o Claude da Anthropic.
A técnica combina duas estratégias: usar dados sintéticos gerados pelo próprio modelo grande e aplicar uma perda de destilação baseada em divergência KL (uma medida matemática que compara quão diferentes são as respostas de dois modelos). A Multiverse testou o método em vários modelos de base, como Llama (família de modelos de código aberto da Meta) e Mistral (outro modelo open-source popular entre desenvolvedores), e reportou que os modelos menores resultantes conseguem desempenho próximo ao dos originais em tarefas como responder perguntas, resumir textos e seguir instruções — mas rodando muito mais rápido e consumindo menos memória.
Para o mercado brasileiro, onde infraestrutura de nuvem costuma ser mais cara e empresas menores têm orçamentos limitados para IA, a possibilidade de criar modelos sob medida sem depender de GPUs de última geração (chips especializados em processar IA) pode ser um divisor de águas. A Multiverse disponibilizou código de exemplo no GitHub e promete liberar mais detalhes nos próximos meses, o que pode facilitar a adoção da técnica por startups e equipes de pesquisa com menos recursos.


