Marvell Technology anunciou um portfólio de desagregação de memória de três pilares projetado para abordar a restrição crítica da infraestrutura de IA: mover memória mais próxima do computação e reduzir gargalos de dados em inferência em larga escala. O conjunto inclui o controlador Bravera SC6 PCIe 6.0 para armazenamento de IA anexado ao servidor (cache chave-valor), a família Structera CXL para pooling de memória em escala de rack e expansão, e o Photonic Fabric para arquiteturas de memória compartilhada abrangendo até 50 metros em múltiplos racks. A estratégia trata memória como um recurso fluido distribuído pela pilha, não um ativo fixo local do servidor.
A família Structera CXL combina expansão de memória (reciclagem de DDR4 existente via compressão para atingir capacidade efetiva de 2–2,5x) com um acelerador de computação próximo à memória para mecanismos de recomendação e busca de vetor, mais um switch CXL 3.1 para desagregação em nível de rack. Photonic Fabric estende o conceito entre racks usando links ópticos, apoiando até 32 TB de offload de cache KV quente e reivindicando melhoria de throughput de token de 2–3x dentro de restrições de energia e footprint existentes. Estes produtos abram diretamente o deslocamento de otimização centrada em GPU para eficiência em nível de sistema, onde mover dados de forma mais eficiente importa tanto quanto throughput de acelerador bruto.
Para planejadores de infraestrutura de IA, o portfólio de Marvell aponta para o gargalo de largura de banda de memória que agora limita escalabilidade de inferência. Como cargas de trabalho de geração de tokens crescem e janelas de contexto expandem, arquiteturas que agrupam memória em múltiplas GPUs ou racks—em vez de distribuir capacidade por-GPU—tornam-se necessárias para economias de custo-por-token. Hiperscalers como Meta já estão implantando expansão de memória baseada em CXL em milhões de servidores; o portfólio de ponta a ponta de Marvell (armazenamento, switch CXL, óptico) sugere que o próximo campo de batalha competitivo não é FLOPS de pico mas elasticidade de infraestrutura e custo operacional.