Cerebras Systems presentó la CS-4, el acelerador de IA de cuarta generación de la empresa, afirmando que ofrece una inferencia hasta 30 veces más rápida que los sistemas GPU. La CS-4 se construye a partir de tres nuevos procesadores Wafer Scale Engine 3 Turbo (WSE-3T) y representa el primer miembro de la plataforma de escala de rack Cerebras Nexus. En los puntos de referencia GPT-OSS-120B, la CS-4 entrega más de 4.400 tokens por segundo por usuario versus aproximadamente 150 tokens/seg en sistemas GPU competitivos, y es el doble de rápida que el anterior CS-3.
El sistema integra 44 GB de SRAM en cada oblea y logra 750 petaFLOPs de cómputo con 129.6 petabytes por segundo de ancho de banda de memoria en tres obleas. Una innovación clave es la interconexón de oblea a oblea de baja latencia, reducida a tan solo 2 microsegundos, compatible con modelos de más de 50 billones de parámetros. La arquitectura modular Nexus también ofrece hasta 10x más rendimiento por vatio que la CS-3, mejorando directamente la economía del centro de datos. Los primeros envíos comienzan este trimestre.
Cerebras posiciona CS-4 para arquitecturas de inferencia desagregada: los sistemas de relleno externo (AMD Helios, AWS Trainium) manejan el procesamiento de indicaciones, mientras que CS-4 maneja la decodificación de laténcia ultra baja y la generación de tokens. Esta división permite que las aplicaciones agentes realicen más razonamiento complejo y verificación dentro del mismo tiempo real. Para los arquitectos, la ventaja de velocidad de 30x se traduce directamente en latencia operacional reducida para IA interactiva y mejoras de costo por token medibles en cargas de trabajo de razonamiento de múltiples vueltas—un desafío directo a la dominancia de NVIDIA en la aceleración de la fase de inferencia.