A Marvell Technology está lançando um portfólio de desagregação de memória em três camadas direcionado à largura de banda e capacidade de memória — as restrições que agora limitam o escalonamento de inferência de IA mais do que a computação bruta. O lançamento abrange SSD anexado ao servidor, pooling CXL em nível de rack e memória compartilhada óptica entre racks, cada um direcionado a um raio diferente da GPU.

A tese é simples: em grandes clusters de inferência executando modelos com footprints de memória multi-centenas de GB e janelas de contexto longas, a pressão do KV-cache e a saturação da largura de banda da memória chegam antes que os orçamentos de FLOP sejam esgotados. A Marvell desagrega a memória da computação, então a reconecta em qualquer distância que a carga de trabalho exigir. Khurram Malik, vice-presidente associado de marketing de produtos, diz que os próximos ganhos de desempenho vêm "não apenas de processadores mais rápidos, mas também de melhores maneiras de armazenar, fazer pool e mover memória."

No nível do servidor, a Bravera SC6 é um controlador SSD PCIe 6.0 para offload de cache de chave-valor. Seu recurso diferenciador é uma camada de tradução de flash gerenciada pelo host — os hiperscalers controlam diretamente a amplificação de escrita, coleta de lixo e nivelamento de desgaste em vez de delegar ao firmware. Como Malik coloca: "Os clientes finais conhecem seus workloads. Eles escrevem no NAND com base em seus workloads e gerenciam a amplificação de escrita, o que se transforma na resistência dos SSDs." O suporte a múltiplos fornecedores de NAND importa quando as cadeias de suprimento de SSD são instáveis.

No nível de rack, a Structera CXL abrange três sub-produtos. A Structera X lida com expansão de memória usando inventário DDR4 ou DDR5 existente, com compressão onboard gerando capacidade efetiva de 2–2,5× versus configurações padrão. A reutilização de DDR4 já está em produção: a Meta executa expansão de memória baseada em CXL em milhões de servidores, extraindo módulos DDR4 de máquinas descomissionadas em vez de comprar novos. Malik é direto: "O primeiro e mais importante caso de uso dentro de CXL é a reciclagem de DDR4." A Structera A adiciona um acelerador de computação perto da memória ao lado do controlador de memória, descarregando ciclos de CPU e GPU para inferência de recomendação, busca vetorial e operações de banco de dados. A Structera S4 é um switch CXL 3.1 que conecta CPUs e GPUs a pools CXL mesmo quando o silício do host não tem lanes CXL nativos — inclui uma camada de conversão de protocolo PCIe-over-CXL, crítica para clusters construídos em gerações de GPU mais antigas.

Além do rack, a Photonic Fabric da Marvell usa links ópticos para estender um tier de memória compartilhada até 50 metros — abrangendo racks adjacentes dentro de um pod do data center. O alvo é inferência de contexto longo: modelos onde apenas o KV-cache sobrecarrega a DRAM por servidor. A Photonic Fabric descarrega até 32 TB de KV-cache quente, e a Marvell afirma uma melhoria de throughput de token de 2–3× no mesmo envelope de potência e footprint de data center, embora a empresa reconheça que o ganho real é dependente de workload. Essa ressalva importa: a figura de 2–3× assume um workload limitado por largura de banda de memória; configurações limitadas por computação verão menos.

A implantação de milhões de servidores da Meta em CXL é a prova mais concreta da adoção do hiperscaler, mas é expansão de memória, não desagregação completa. A Photonic Fabric é a aposta arquitetural mais ousada — a memória compartilhada óptica introduz novos modos de falha, jitter de latência em links de 50 metros e complexidade operacional que a DDR em nível de rack não tem. Para arquitetos dimensionando isso agora, a ação de curto prazo fica em Structera X e S4, onde a reutilização de DDR4 e pooling CXL funcionam sem mudanças de infraestrutura óptica.

Se o gargalo do seu cluster de inferência é a capacidade do KV-cache ou a largura de banda da memória — não a taxa de transferência de FLOP — a stack em três camadas da Marvell oferece um caminho de produto em cada raio, desde SSD do servidor até memória compartilhada óptica entre racks. O ponto de entrada de reciclagem de DDR4 é o primeiro passo de menor risco; salve a avaliação da Photonic Fabric para clusters onde o offload de 32 TB de cache quente muda a economia.