Nvidia diz que seu chip é quatro vezes mais rápido que o da Cerebras, mas a comparação esconde detalhes importantes
A fabricante de chips afirma que seu Groq 3 LPX processa 3.400 tokens por segundo, mas precisa de pelo menos 64 aceleradores para atingir esse desempenho, enquanto a rival Cerebras usa apenas um ou dois.
A Nvidia afirma que seu chip Groq 3 LPX (processador para rodar modelos de IA) é quatro vezes mais rápido que o da Cerebras, atingindo 3.400 tokens por segundo. Porém, precisa de pelo menos 64 aceleradores (chips trabalhando juntos) para isso, enquanto a Cerebras usa apenas um ou dois, o que muda o custo e a eficiência real da comparação.

A Nvidia anunciou que está levando seu chip de inferência Groq 3 LPX (um processador especializado em executar modelos de inteligência artificial já treinados, gerando respostas em tempo real) para produção em larga escala. Segundo a empresa, o chip processa 3.400 tokens (as unidades básicas de texto que um modelo de IA lê ou gera) por segundo ao rodar o modelo Gemma 4 31B (um modelo de linguagem com 31 bilhões de parâmetros, ou seja, valores ajustáveis que definem seu comportamento), o que seria quatro vezes mais rápido que a solução da Cerebras, sua concorrente direta.
Mas os números contam apenas parte da história. Conforme reportou o site The Register, a Nvidia precisa de pelo menos 64 aceleradores (chips especializados que trabalham em paralelo) para atingir essa velocidade, enquanto a Cerebras consegue desempenho comparável com apenas um ou dois chips. Essa diferença afeta diretamente o custo, o consumo de energia e a complexidade da infraestrutura necessária para rodar os modelos.
A arquitetura da Nvidia pode ser vantajosa em certos cenários, especialmente quando há necessidade de escalar a capacidade de processamento de forma modular. Mas a comparação direta de velocidade perde contexto se não levar em conta quantos recursos cada solução exige para chegar ao resultado anunciado.
Outra questão em aberto é como a arquitetura do Groq 3 LPX se comporta ao rodar modelos MoE (Mixture of Experts, uma técnica que divide o modelo em partes especializadas para economizar processamento), que estão se tornando cada vez mais comuns. Segundo informou o The Decoder, ainda não há dados públicos que esclareçam se a abordagem da Nvidia mantém a mesma eficiência com esse tipo de modelo.


