Samsung y SK Hynix están impulsando una nueva clase de memoria para su uso comercial, apostando a que la inferencia de IA está superando la costosa memoria de alto ancho de banda apilada junto a las GPU. La tecnología, Compute Express Link (CXL), añade una capa entre la DRAM convencional y el almacenamiento SSD más lento: una forma de dar a los sistemas de IA mucha más memoria direccionable sin depender solo de la escasa y costosa HBM.
Qué cambia CXL
Los grandes modelos necesitan mantener enormes conjuntos de parámetros y contexto cerca del procesador. La HBM es rápida, pero limitada en capacidad y suministro; la DRAM del sistema es más barata, pero está restringida por la cantidad que un servidor puede albergar físicamente. CXL permite agrupar y compartir memoria entre dispositivos mediante una interconexión de alta velocidad, ampliando la memoria efectiva a la que puede acceder una GPU, algo directamente relevante para prestar grandes modelos a escala.
Las demostraciones
SK Hynix mostró un módulo de segunda generación 256GB CMM-DDR5 sobre CXL 3.2, y sus investigadores informaron de aumentos de rendimiento de hasta 35.7% en cargas de trabajo de inferencia. Samsung probó una pila de memoria CXL de 1TB que alcanzó alrededor del 92% del rendimiento de inferencia de la DRAM en ocho GPU, lo bastante cerca de la memoria a plena velocidad como para ser utilizable en producción y, al mismo tiempo, añadir mucha más capacidad.
Calendario y dependencias
Samsung apunta a una producción a finales de 2026 de su módulo CMM-D, aunque podría retrasarse a 2027 porque la adopción de CXL depende de plataformas de servidor de Intel y AMD retrasadas que admitan el estándar. Yim So-jung, analista de Eugene Investment & Securities, dijo que CXL "realmente despega a partir de 2026", con servidores convencionales compatibles con CXL llegando en 2028.
Un segundo frente en la guerra de la memoria
Para los gigantes coreanos, CXL es una forma de vender más memoria a los sistemas de IA más allá de la HBM que ya dominan —y de abordar el techo de capacidad que la HBM por sí sola no puede رفعar. Sitúa a la memoria, no solo a las GPU, como una palanca sobre cuán grandes y cuán barato pueden prestarse los modelos de IA.
