aiexpert
Início / Notícias / Nota
Chips · 21 de ago. de 2026, 01:35 · 4 fontes

Cerebras CS-4 atinge velocidade GPU 30x em inferência; 4.400 tokens/seg em modelos de 120B, primeiros envios Q3

Cerebras Systems apresentou a CS-4, o acelerador de IA de quarta geração da empresa, alegando inferência até 30x mais rápida do que sistemas GPU. A CS-4 é construída a partir de três novos processadores Wafer Scale Engine 3 Turbo (WSE-3T) e representa o primeiro membro da plataforma de escala de rack Cerebras Nexus. Em benchmarks GPT-OSS-120B, a CS-4 entrega mais de 4.400 tokens por segundo por usuário versus aproximadamente 150 tokens/seg em sistemas GPU competitivos, e é duas vezes mais rápida do que a CS-3 anterior.

O sistema integra 44GB de SRAM em cada wafer e atinge 750 petaFLOPs de computa com 129,6 petabytes por segundo de largura de banda de memória em três wafers. Uma inovação fundamental é a interconexão de wafer-to-wafer de baixa latência, reduzida a tão pouco quanto 2 microssegundos, suportando modelos com mais de 50 trilhões de parâmetros. A arquitetura modular Nexus também oferece até 10x mais taxa de transferência por watt do que a CS-3, melhorando diretamente a economia de data center. Os primeiros envios começam neste trimestre.

Cerebras posiciona CS-4 para arquiteturas de inferência desagregadas: sistemas de prefill externos (AMD Helios, AWS Trainium) lidam com processamento de prompt, enquanto CS-4 manipula decodificação de ultra-baixa latência e geração de token. Esta divisão permite que aplicações agentes realizem raciocínio mais complexo e verificação no mesmo tempo de parede. Para arquitetos, a vantagem de velocidade 30x se traduz diretamente em latência operacional reduzida para IA interativa e melhorias de custo-por-token mensuráveis em cargas de trabalho de raciocínio de múltiplas voltas—um desafio direto à dominância da NVIDIA na aceleração de fase de inferência.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source cerebras.ai
  2. 02 cerebras.ai cerebras.ai “Cerebras CS-4 delivers up to 30x faster AI inference than GPUs, with a modular rack-scale architecture built for hyperscale AI deployment.”
  3. 03 investors.cerebras.ai investors.cerebras.ai “The CS-4 is a rack-scale solution built from three new Wafer Scale Engines and revolutionary rack and system designs. The CS-4 is the first member of the next-generation Cerebras Nexus rack-scale platform architecture. It is up to twice as fast as the CS-3, bringing the CS-4s advantage in tokens-per-second-per-user over GPUs to up to 30x more.”
  4. 04 investors.cerebras.ai investors.cerebras.ai “In a head-to-head comparison on GPT-OSS-120B, when given identical prompts, the CS-4 delivers more than 4,400 tokens second per user (TPS/user), up to 30 times faster than GPU solutions.”