Samsung et SK Hynix poussent une nouvelle classe de mémoire vers un usage commercial, pariant que l’inférence IA dépasse la coûteuse mémoire à large bande passante empilée à côté des GPU. La technologie, Compute Express Link (CXL), ajoute une couche entre la DRAM conventionnelle et le stockage SSD plus lent — un moyen de donner aux systèmes d’IA bien plus de mémoire adressable sans dépendre uniquement de la HBM, rare et coûteuse.
Ce que change CXL
Les grands modèles doivent conserver d’immenses ensembles de paramètres et le contexte à proximité du processeur. La HBM est rapide, mais limitée en capacité et en approvisionnement ; la DRAM système est moins chère, mais contrainte par la quantité qu’un serveur peut physiquement accueillir. CXL permet de mutualiser et de partager la mémoire entre plusieurs appareils via une interconnexion à haut débit, élargissant la mémoire effective qu’un GPU peut atteindre — un point directement pertinent pour servir de grands modèles à l’échelle.
Les démonstrations
SK Hynix a présenté un module de deuxième génération 256GB CMM-DDR5 sur CXL 3.2, et ses chercheurs ont fait état de gains de débit allant jusqu’à 35.7% sur des charges d’inférence. Samsung a testé un pool mémoire CXL de 1TB atteignant environ 92% des performances d’inférence au niveau de la DRAM sur huit GPU — suffisamment proche d’une mémoire à pleine vitesse pour être exploitable en production, tout en ajoutant bien plus de capacité.
Calendrier et dépendances
Samsung vise une production de son module CMM-D d’ici la fin de l’année 2026, même si elle pourrait glisser à 2027 car l’adoption de CXL dépend de plates-formes serveurs Intel et AMD retardées, qui prennent en charge la norme. Yim So-jung, analyste chez Eugene Investment & Securities, a déclaré que CXL « prend vraiment son essor à partir de 2026 », les serveurs grand public compatibles CXL arrivant d’ici 2028.
Un second front dans la guerre de la mémoire
Pour les géants coréens, CXL est un moyen de vendre davantage de mémoire dans les systèmes d’IA au-delà de la HBM qu’ils dominent déjà — et de répondre au plafond de capacité que la HBM seule ne peut pas relever. Cela place la mémoire, et pas seulement les GPU, comme un levier sur la taille des modèles d’IA pouvant être servis et sur leur coût.
