Agentes de IA agora criam código otimizado para GPUs sem precisar de programadores especializados
Hugging Face mostra como modelos de linguagem podem escrever kernels CUDA — trechos de código que aceleram processamento em placas de vídeo — democratizando uma tarefa que antes exigia anos de experiência técnica.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) publicou um experimento que mostra agentes de IA escrevendo kernels CUDA — trechos de código que rodam diretamente na GPU (a placa de vídeo do computador) para acelerar cálculos complexos. Historicamente, escrever esse tipo de código exigia conhecimento profundo de arquitetura de hardware e anos de prática; agora, modelos como o Claude e o GPT-4o (LLMs, ou modelos de linguagem de grande escala) conseguem gerar versões funcionais a partir de uma descrição em texto simples.
O exemplo prático usado pela equipe foi uma operação chamada RoPE (Rotary Position Embedding, uma técnica matemática usada para que modelos de IA entendam a posição das palavras em uma frase). O agente gerou código CUDA que roda até 5 vezes mais rápido que a versão padrão escrita em PyTorch (um framework popular de programação para IA), porque aproveita melhor os recursos da GPU — como memória compartilhada e execução paralela de milhares de cálculos ao mesmo tempo.
O processo funciona assim: você descreve o que quer otimizar, o agente escreve o kernel, testa, ajusta o código caso dê erro e repete até funcionar. A Hugging Face disponibilizou o código aberto do sistema, chamado de "skill" (habilidade) para agentes, permitindo que qualquer pessoa com acesso aos modelos replique o método. Segundo a empresa, a técnica pode ser aplicada a operações customizadas em áreas como processamento de imagens médicas, simulações científicas ou qualquer tarefa que dependa de velocidade de processamento.
A novidade não elimina a necessidade de especialistas — código gerado por IA ainda precisa ser revisado e testado em escala —, mas reduz drasticamente o tempo de prototipagem. Pesquisadores e pequenas equipes que antes dependiam de bibliotecas prontas agora podem criar soluções sob medida sem contratar engenheiros de CUDA. O post completo, com exemplos de código e benchmarks (testes de desempenho), está disponível no blog oficial da Hugging Face.


