Hugging Face usa Claude para ensinar modelos abertos a programar GPUs
Plataforma treinou modelos de código aberto para escrever kernels CUDA — programas que rodam direto em placas de vídeo — usando o Claude como professor.

A Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA) divulgou um experimento que usa o Claude, modelo da Anthropic, para ensinar outros modelos de inteligência artificial a programar diretamente para GPUs (placas de vídeo usadas para acelerar cálculos de IA). A técnica envolve criar kernels CUDA — pequenos programas que rodam direto no hardware da Nvidia — e usar essas instruções para treinar modelos abertos menores.
O projeto, chamado Upskill, funciona assim: o Claude gera exemplos de código CUDA otimizado, explicando passo a passo como resolver problemas específicos de programação paralela (quando um computador executa muitas operações ao mesmo tempo). Esses exemplos são então usados para treinar modelos de código aberto, como o DeepSeek ou Qwen, permitindo que eles aprendam a tarefa sem precisar de milhões de exemplos criados por humanos.
Segundo a Hugging Face, a abordagem reduz drasticamente o tempo necessário para que modelos menores dominem tarefas complexas de programação de baixo nível — aquelas que lidam diretamente com processadores e memória, sem camadas de abstração. O método também permite que desenvolvedores com menos recursos consigam treinar modelos especializados sem acesso a datasets (conjuntos de dados) gigantescos ou infraestrutura cara.
A técnica ilustra uma tendência recente: usar modelos proprietários grandes, como o Claude ou GPT-4, como "professores" para destilar conhecimento em modelos abertos e mais leves. Isso democratiza capacidades que antes ficavam restritas a quem paga por APIs (interfaces de programação) de grandes empresas, permitindo que qualquer um rode esses modelos localmente, sem depender da nuvem.
O código e os datasets gerados estão disponíveis publicamente na plataforma da Hugging Face. A empresa não informou se pretende expandir a técnica para outras linguagens de programação ou domínios técnicos além de CUDA.


