Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)

Técnicas simples de otimização podem fazer um modelo de linguagem responder até três vezes mais rápido, sem perder qualidade — e estão disponíveis para qualquer desenvolvedor.

Por Redação2 min
Em resumo

A Hugging Face (plataforma de compartilhamento de modelos de IA) liberou três técnicas de otimização que a OpenAI usa internamente — cache estático de KV, speculative decoding e chunked prefill — e que podem fazer modelos de linguagem (programas que entendem e geram texto) responderem até três vezes mais rápido, sem perder qualidade.

Compartilhar
Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)
Ferramentas · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) revelou três técnicas de otimização que a OpenAI usa internamente e que qualquer pessoa pode aplicar para acelerar modelos de linguagem — os programas que entendem e geram texto, como o ChatGPT. Segundo informou a equipe da Hugging Face, essas melhorias podem fazer um modelo responder até três vezes mais rápido, sem comprometer a qualidade das respostas.

A primeira técnica é o cache estático de KV (uma forma de guardar partes já processadas da conversa na memória para não recalcular tudo a cada resposta). A segunda é o speculative decoding (um método em que um modelo menor e rápido sugere várias palavras de uma vez, que o modelo maior apenas confirma ou corrige, economizando tempo). A terceira é o chunked prefill (dividir textos longos em pedaços menores para que o modelo processe de forma mais eficiente, sem travar a GPU — o chip especializado em cálculos de IA).

Todas essas técnicas já estão integradas na biblioteca Transformers (o software de código aberto mais usado para rodar modelos de linguagem), o que significa que qualquer desenvolvedor pode ativá-las com poucas linhas de código. A Hugging Face testou as otimizações em modelos populares como o Llama (uma família de modelos de código aberto do Meta) e o Qwen (criado pela empresa chinesa Alibaba), confirmando ganhos de velocidade sem perda de precisão.

A descoberta é relevante porque a velocidade de resposta é um dos maiores gargalos para quem quer rodar modelos de linguagem em aplicações reais — especialmente em hardware limitado ou em serviços que atendem muitos usuários ao mesmo tempo. Com essas técnicas, um chatbot rodando num servidor comum pode se aproximar da performance de soluções mais caras, democratizando o acesso a IA de qualidade para startups e projetos menores.

Fonte original
Hugging Face Blog
Mais em · Ferramentas