AMD e Cerebras se unem em inferência de IA desagregada; reclamam ganhos de eficiência de 5x
AMD e Cerebras anunciaram uma parceria técnica para fornecer uma plataforma desagregada de inferência de IA combinando sistemas rackscale AMD Helios com o Cerebras Wafer-Scale Engine (WSE). Revelada no Advancing AI 2026 em 23 de julho, a solução conjunta emparelha o Helios de alto rendimento da AMD (72 GPUs MI455X por rack, 31TB HBM4) com o WSE-3 de ultra-baixa latência da Cerebras (900.000 núcleos, 44GB SRAM on-die). Juntos, eles afirmam até 5x maiores tokens por segundo por watt versus configurações WSE apenas da Cerebras.
AMD Helios lía o estágio de contexto/preenchimento—processando prompts e grandes janelas de contexto em alto rendimento—enquanto Cerebras WSE acelera o estágio de decodificação/geração intensiva de memória com latência sub-10ms por token. Essa abordagem desagregada espelha a estratégia NVIDIA Rubin CPX, mas inverte a especialização: AMD visa rendimento, Cerebras visa latência. O resultado é posicionado para aplicações priorizando interação em tempo real: copiões, agentes ao vivo, fluxos de trabalho autônomos e descoberta científíca.
Cerebras planeja implantar AMD Helios em seus próprios data centers, com a solução conjunta esperada estar disponível inicialmente por meio da Cerebras Cloud em H2 2026. Para arquitetos: essa parceria aborda um gargalo real—NVIDIA Rubin também buscou desagregação pela mesma razão. A questão para compradores é a paridade de recursos e o ecossistema de software. AMD e Cerebras devem demonstrar que a inferência mista entre Helios + WSE corresponde à facilidade de pilhas de fornecedor único, particularmente para equipes migrando de NVIDIA.