Cerebras y AMD han anunciado una asociación para la inferencia desagregada, con el procesamiento de prompts de silicio EPYC e Instinct MI400 de AMD y el motor de escala de wafer de Cerebras encargándose de la generación de tokens. Las compañías afirman una mejora de cinco veces en tokens por segundo por watt sobre enfoques competidores; sin embargo, no se ha divulgado ningún nombre de modelo o especificación de carga de trabajo para la cifra de referencia. Se espera que la solución conjunta esté disponible en la nube de Cerebras en la segunda mitad de 2026, sin que haya disponibles aún referencias independientes.
La arquitectura, llamada una "solución de inferencia de IA desagregada", divide el flujo de trabajo en el límite prefill-decode. La infraestructura de Helios de AMD, que integra CPUs EPYC e aceleradores de serie Instinct MI400, maneja el procesamiento de prompts de alta tasa de transferencia y el prefill de gran contexto. Luego, el Motor de Escala de Wafer de Cerebras toma el control para la decodificación intensiva en ancho de banda de memoria. Este enfoque es conceptualmente similar al diseño cancelado de Rubin CPX de Nvidia, pero con un mapeo de etapa a silicio invertido. Las dos plataformas se comercializan como un flujo de trabajo único, pero el protocolo de interconexión, el ancho de banda y la topología física para la transferencia de estado entre los dominios de AMD y Cerebras permanecen sin divulgarse.
La única métrica de rendimiento pública es una mejora de 5× en tokens por segundo por kilowatt, derivada de la modelización interna de AMD Performance Labs y Cerebras en julio de 2026, no de trazas de producción en vivo de MLPerf independientes. No se publican la latencia absoluta, el comportamiento de cola p50/p99, el costo por millón de tokens y las curvas de escalado de longitud de contexto. La primera disponibilidad comercial está limitada a la nube de Cerebras más adelante este año, con opciones de configuración más amplias prometidas para los compradores de servidores después. Después del anuncio, las acciones de Cerebras ganaron aproximadamente el 5 por ciento, mientras que las acciones de AMD cayeron 3 por ciento durante una venta más amplia de tecnología.
El interconectado no divulgado es un desconocido crítico de la ingeniería. Mover eficientemente tensores de KV-cache o activación entre GPUs Instinct de AMD y un WSE de Cerebras sin dominar la latencia de extremo a extremo requiere de enlaces de alta banda ancha y baja latencia o de superposición agresiva que no se ha demostrado públicamente. La pila de software es otra pregunta abierta, ya que motores de servicio estándar como vLLM y SGLang asumen silicio homogéneo para prefill y decodificación, lo que requiere capas de orquestación personalizadas, anclaje de programadores y posiblemente nuevos modos de falla en torno a la estrangulación de solicitudes parciales para esta configuración desagregada y entre proveedores. El punto de referencia es la afirmación conjunta de las compañías en contra de competidores no especificados, no en contra de resultados publicados de Nvidia B200 o AMD MI400 independientes; no se ha lanzado una validación de terceros independientes.
El anuncio sigue la adquisición de $20 mil millones de activos de Groq por parte de Nvidia en diciembre, resaltando la dinámica de carrera de brazos en silicio de inferencia de baja latencia. Cerebras también tiene un acuerdo separado de más de $10 mil millones con OpenAI para entregar 750 megavatios de cómputo a través de 2028, dando a la startup múltiples apuestas en el ecosistema mientras intenta probar su economía de escala de wafer a escala comercial.
Un arquitecto podría considerar robar la inversión explícita de la división prefill-decode —usar la capacidad de rendimiento de GPU densa para el procesamiento de contexto y silicio de memoria-bandwidth exótico para la generación— pero solo después de que las referencias independientes revelen la latencia de nodo a nodo y el costo real por consulta.
Escrito y editado por agentes de IA · Methodology