Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

NegóciosThe Decoder1 min

Nvidia diz que seu chip é quatro vezes mais rápido que o da Cerebras, mas a comparação esconde detalhes importantes

A fabricante de chips afirma que seu Groq 3 LPX processa 3.400 tokens por segundo, mas precisa de pelo menos 64 aceleradores para atingir esse desempenho, enquanto a rival Cerebras usa apenas um ou dois.

Por Redação1 min
Em resumo

A Nvidia afirma que seu chip Groq 3 LPX (processador para rodar modelos de IA) é quatro vezes mais rápido que o da Cerebras, atingindo 3.400 tokens por segundo. Porém, precisa de pelo menos 64 aceleradores (chips trabalhando juntos) para isso, enquanto a Cerebras usa apenas um ou dois, o que muda o custo e a eficiência real da comparação.

Compartilhar
Nvidia diz que seu chip é quatro vezes mais rápido que o da Cerebras, mas a comparação esconde detalhes importantes
Negócios · The Decoder

A Nvidia anunciou que está levando seu chip de inferência Groq 3 LPX (um processador especializado em executar modelos de inteligência artificial já treinados, gerando respostas em tempo real) para produção em larga escala. Segundo a empresa, o chip processa 3.400 tokens (as unidades básicas de texto que um modelo de IA lê ou gera) por segundo ao rodar o modelo Gemma 4 31B (um modelo de linguagem com 31 bilhões de parâmetros, ou seja, valores ajustáveis que definem seu comportamento), o que seria quatro vezes mais rápido que a solução da Cerebras, sua concorrente direta.

Mas os números contam apenas parte da história. Conforme reportou o site The Register, a Nvidia precisa de pelo menos 64 aceleradores (chips especializados que trabalham em paralelo) para atingir essa velocidade, enquanto a Cerebras consegue desempenho comparável com apenas um ou dois chips. Essa diferença afeta diretamente o custo, o consumo de energia e a complexidade da infraestrutura necessária para rodar os modelos.

A arquitetura da Nvidia pode ser vantajosa em certos cenários, especialmente quando há necessidade de escalar a capacidade de processamento de forma modular. Mas a comparação direta de velocidade perde contexto se não levar em conta quantos recursos cada solução exige para chegar ao resultado anunciado.

Outra questão em aberto é como a arquitetura do Groq 3 LPX se comporta ao rodar modelos MoE (Mixture of Experts, uma técnica que divide o modelo em partes especializadas para economizar processamento), que estão se tornando cada vez mais comuns. Segundo informou o The Decoder, ainda não há dados públicos que esclareçam se a abordagem da Nvidia mantém a mesma eficiência com esse tipo de modelo.

Fonte original
The Decoder
Mais em · Negócios