Cerebras Systems apresentou a CS-4, o acelerador de IA de quarta geração da empresa, alegando inferência até 30x mais rápida do que sistemas GPU. A CS-4 é construída a partir de três novos processadores Wafer Scale Engine 3 Turbo (WSE-3T) e representa o primeiro membro da plataforma de escala de rack Cerebras Nexus. Em benchmarks GPT-OSS-120B, a CS-4 entrega mais de 4.400 tokens por segundo por usuário versus aproximadamente 150 tokens/seg em sistemas GPU competitivos, e é duas vezes mais rápida do que a CS-3 anterior.
O sistema integra 44GB de SRAM em cada wafer e atinge 750 petaFLOPs de computa com 129,6 petabytes por segundo de largura de banda de memória em três wafers. Uma inovação fundamental é a interconexão de wafer-to-wafer de baixa latência, reduzida a tão pouco quanto 2 microssegundos, suportando modelos com mais de 50 trilhões de parâmetros. A arquitetura modular Nexus também oferece até 10x mais taxa de transferência por watt do que a CS-3, melhorando diretamente a economia de data center. Os primeiros envios começam neste trimestre.
Cerebras posiciona CS-4 para arquiteturas de inferência desagregadas: sistemas de prefill externos (AMD Helios, AWS Trainium) lidam com processamento de prompt, enquanto CS-4 manipula decodificação de ultra-baixa latência e geração de token. Esta divisão permite que aplicações agentes realizem raciocínio mais complexo e verificação no mesmo tempo de parede. Para arquitetos, a vantagem de velocidade 30x se traduz diretamente em latência operacional reduzida para IA interativa e melhorias de custo-por-token mensuráveis em cargas de trabalho de raciocínio de múltiplas voltas—um desafio direto à dominância da NVIDIA na aceleração de fase de inferência.