Memória LPDDR e SOCAMM ganham tração em data centers de IA conforme abastecimento de HBM se aperta
EE Times relata que memória DRAM de baixa potência (LPDDR) e pequeno módulo de memória comprimida acoplada (SOCAMM) estão ganhando adoção em data centers de IA conforme abastecimento de memória de banda larga alta (HBM) se torna restrito e cargas de trabalho de inferência substituem treinamento como o padrão de computação dominante. LPDDR, originalmente projetado para smartphones, e SOCAMM, um fator de forma compacto, oferecem vantagens significativas de eficiência de potência: SOCAMM consome um terço da potência de RDIMM DDR5 padrão enquanto permite maior memória por socket e densidade.
O SOCAMM de 256GB lançado recentemente pela Micron é projetado para construções de servidor denso e descarrega KV-cache de HBM, melhorando desempenho-por-watt para inferência e cargas de trabalho de IA em produção. Praveen Vaidyanathan, VP de Cloud Memory Products na Micron, disse à EE Times: "A oportunidade para DRAM de baixa potência no data center é muito alta. Cargas de trabalho emergentes como modelos mixture-of-experts, IA multimídia e sistemas agentes estão aumentando demanda por memória perto de computa, e janelas de contexto longo estão se tornando mais comuns."
A hierarquia de memória está sendo reorganizada: Micron posiciona KV cache quente em HBM, KV cache morno em DRAM de baixa potência e KV cache frio em armazenamento rápido. Rambus anunciou de forma similar SOCAMM2, um chipset de módulo de servidor baseado em LPDDR para futuros sistemas de IA. Jim Handy, analista principal com Objective Analysis, observa que operadores em hiper-escala estão dispostos a pagar por eficiência porque "desempenho por watt é um fator decisivo, especialmente quando IA está consumindo uma grande participação de gastos em data center."
Para arquitetos de data center, a adoção de LPDDR e SOCAMM sinaliza uma mudança para longe de estratégias de inferência somente HBM: uma abordagem de memória em camadas equilibra capacidade, latência e custo total de propriedade conforme inferência se torna a carga de trabalho de IA dominante. Esta mudança arquitetônica afeta procurement de GPU, sourcing de módulo de memória, e oramentos de refrigeração/potência em toda a stack.
Fontes
- Primary source
- Dynamic AI Demands Drive Memory Diversity
“The opportunity for low-power DRAM in the data center is very high. Hot KV cache remains in HBM, the warm KV cache remains in low-power DRAM, and the cold KV cache goes to fast storage.”