Marvell Technology está implementando un portafolio de desagregación de memoria de tres niveles dirigido al ancho de banda y la capacidad de memoria, las restricciones que ahora limitan el escalado de inferencia de IA más que la computación bruta. El lanzamiento abarca SSD conectado al servidor, agrupamiento CXL a nivel de rack y memoria compartida óptica entre racks, cada uno dirigido a un radio diferente de la GPU.

La tesis es simple: en grandes clusters de inferencia que ejecutan modelos con footprints de memoria multi-cientos de GB y ventanas de contexto largo, la presión de KV-cache y la saturación del ancho de banda de memoria llegan antes de que se agoten los presupuestos de FLOP. Marvell desagrega la memoria de la computación y luego la reconecta a cualquier distancia que la carga de trabajo requiera. Khurram Malik, vicepresidente asociado de marketing de productos, dice que las próximas ganancias de rendimiento provienen "no solo de procesadores más rápidos, sino también de mejores formas de almacenar, agrupar y mover memoria."

A nivel de servidor, la Bravera SC6 es un controlador SSD PCIe 6.0 para descarga de caché clave-valor. Su característica diferenciadora es una capa de traducción de flash gestionada por el host: los hiperscalers controlan directamente la amplificación de escritura, la recolección de basura y el nivelamiento de desgaste en lugar de delegarlos al firmware. Como dice Malik: "Los clientes finales conocen sus cargas de trabajo. Escriben en NAND en función de sus cargas de trabajo y gestionan la amplificación de escritura, que se traduce en la resistencia de los SSD." La compatibilidad con múltiples proveedores de NAND importa cuando las cadenas de suministro de SSD son inestables.

A nivel de rack, Structera CXL abarca tres subproductos. Structera X maneja la expansión de memoria utilizando inventario DDR4 o DDR5 existente, con compresión a bordo proporcionando capacidad efectiva de 2–2,5× versus configuraciones estándar. La reutilización de DDR4 ya está en producción: Meta ejecuta expansión de memoria basada en CXL en millones de servidores, extrayendo módulos DDR4 de máquinas desmanteladas en lugar de comprar nuevos. Malik es directo: "El primer y más importante caso de uso dentro de CXL es el reciclaje de DDR4." Structera A agrega un acelerador de computación cercano a la memoria junto al controlador de memoria, descargando ciclos de CPU y GPU para inferencia de recomendación, búsqueda vectorial y operaciones de base de datos. Structera S4 es un conmutador CXL 3.1 que conecta CPUs y GPUs a pools CXL incluso cuando el silicio del host carece de carriles CXL nativos: incluye una capa de conversión de protocolo PCIe-over-CXL, crítica para clusters construidos en generaciones de GPU más antiguas.

Más allá del rack, Photonic Fabric de Marvell utiliza enlaces ópticos para extender un nivel de memoria compartida hasta 50 metros, abarcando racks adyacentes dentro de un pod de centro de datos. El objetivo es inferencia de contexto largo: modelos donde el caché de KV por sí solo abruma la DRAM por servidor. Photonic Fabric descarga hasta 32 TB de caché KV caliente, y Marvell afirma una mejora de rendimiento de token de 2–3× dentro del mismo envolvente de potencia y footprint del centro de datos, aunque la empresa reconoce que la ganancia real depende de la carga de trabajo. Esta salvedad importa: la cifra de 2–3× asume una carga de trabajo limitada por ancho de banda de memoria; las configuraciones limitadas por computación verán menos.

El despliegue de millones de servidores de Meta en CXL es la prueba más concreta de la adopción de hiperscaler, pero es expansión de memoria, no desagregación completa. Photonic Fabric es la apuesta arquitectónica más audaz: la memoria compartida óptica introduce nuevos modos de fallo, jitter de latencia en enlaces de 50 metros y complejidad operativa que la DDR a nivel de rack no tiene. Para arquitectos que estén evaluando esto ahora, la acción a corto plazo se centra en Structera X y S4, donde la reutilización de DDR4 y la agrupación CXL funcionan sin cambios en la infraestructura óptica.

Si el cuello de botella de su cluster de inferencia es la capacidad de KV-cache o el ancho de banda de memoria (no el rendimiento de FLOP), la pila de tres niveles de Marvell le proporciona un camino de producto en cada radio, desde SSD del servidor hasta memoria compartida óptica entre racks. El punto de entrada de reciclaje de DDR4 es el primer paso de menor riesgo; reserve la evaluación de Photonic Fabric para clusters donde la descarga de 32 TB de caché caliente cambia la economía.