aiexpert
Inicio / Noticias / Nota
Chips · 21 ago 2026, 01:35 · 4 fuentes

Cerebras CS-4 alcanza velocidad GPU 30x en inferencia; 4.400 tokens/seg en modelos de 120B, primeros envíos Q3

Cerebras Systems presentó la CS-4, el acelerador de IA de cuarta generación de la empresa, afirmando que ofrece una inferencia hasta 30 veces más rápida que los sistemas GPU. La CS-4 se construye a partir de tres nuevos procesadores Wafer Scale Engine 3 Turbo (WSE-3T) y representa el primer miembro de la plataforma de escala de rack Cerebras Nexus. En los puntos de referencia GPT-OSS-120B, la CS-4 entrega más de 4.400 tokens por segundo por usuario versus aproximadamente 150 tokens/seg en sistemas GPU competitivos, y es el doble de rápida que el anterior CS-3.

El sistema integra 44 GB de SRAM en cada oblea y logra 750 petaFLOPs de cómputo con 129.6 petabytes por segundo de ancho de banda de memoria en tres obleas. Una innovación clave es la interconexón de oblea a oblea de baja latencia, reducida a tan solo 2 microsegundos, compatible con modelos de más de 50 billones de parámetros. La arquitectura modular Nexus también ofrece hasta 10x más rendimiento por vatio que la CS-3, mejorando directamente la economía del centro de datos. Los primeros envíos comienzan este trimestre.

Cerebras posiciona CS-4 para arquitecturas de inferencia desagregada: los sistemas de relleno externo (AMD Helios, AWS Trainium) manejan el procesamiento de indicaciones, mientras que CS-4 maneja la decodificación de laténcia ultra baja y la generación de tokens. Esta división permite que las aplicaciones agentes realicen más razonamiento complejo y verificación dentro del mismo tiempo real. Para los arquitectos, la ventaja de velocidad de 30x se traduce directamente en latencia operacional reducida para IA interactiva y mejoras de costo por token medibles en cargas de trabajo de razonamiento de múltiples vueltas—un desafío directo a la dominancia de NVIDIA en la aceleración de la fase de inferencia.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source cerebras.ai
  2. 02 cerebras.ai cerebras.ai “Cerebras CS-4 delivers up to 30x faster AI inference than GPUs, with a modular rack-scale architecture built for hyperscale AI deployment.”
  3. 03 investors.cerebras.ai investors.cerebras.ai “The CS-4 is a rack-scale solution built from three new Wafer Scale Engines and revolutionary rack and system designs. The CS-4 is the first member of the next-generation Cerebras Nexus rack-scale platform architecture. It is up to twice as fast as the CS-3, bringing the CS-4s advantage in tokens-per-second-per-user over GPUs to up to 30x more.”
  4. 04 investors.cerebras.ai investors.cerebras.ai “In a head-to-head comparison on GPT-OSS-120B, when given identical prompts, the CS-4 delivers more than 4,400 tokens second per user (TPS/user), up to 30 times faster than GPU solutions.”