Samsung e SK Hynix stanno spingendo in uso commerciale una nuova classe di memoria, puntando sul fatto che l’inferenza AI stia superando l’HBM ad alta larghezza di banda, costosa e impilata accanto alle GPU. La tecnologia, Compute Express Link (CXL), aggiunge un livello tra la DRAM convenzionale e il più lento storage SSD — un modo per offrire ai sistemi AI molta più memoria indirizzabile senza fare affidamento esclusivamente sulla scarsa e costosa HBM.

What CXL changes

I grandi modelli devono mantenere enormi set di parametri e contesto vicino al processore. L’HBM è veloce ma limitata in capacità e disponibilità; la DRAM di sistema è più economica, ma vincolata a quanto un server può contenere fisicamente. CXL consente di mettere in pool e condividere la memoria tra dispositivi tramite un’interconnessione ad alta velocità, ampliando la memoria effettiva a cui una GPU può accedere — un aspetto direttamente rilevante per servire modelli di grandi dimensioni su larga scala.

The demos

SK Hynix ha mostrato un modulo di seconda generazione 256GB CMM-DDR5 su CXL 3.2, e i suoi ricercatori hanno riportato incrementi di throughput fino al 35.7% sui carichi di lavoro di inferenza. Samsung ha testato un pool di memoria CXL da 1TB che ha raggiunto circa il 92% delle prestazioni di inferenza a livello DRAM su otto GPU — abbastanza vicino a una memoria a piena velocità da risultare utilizzabile in produzione, aggiungendo però molta più capacità.

Timing and dependencies

Samsung punta alla produzione di fine anno 2026 del suo modulo CMM-D, anche se potrebbe slittare al 2027 perché l’adozione di CXL dipende dalle piattaforme server ritardate di Intel e AMD che supportano lo standard. Yim So-jung, analista di Eugene Investment & Securities, ha affermato che CXL "decolla davvero dal 2026", con server compatibili CXL diffusi sul mercato entro il 2028.

A second front in the memory war

Per i giganti coreani, CXL è un modo per vendere più memoria ai sistemi AI oltre all’HBM che già dominano — e per affrontare il tetto di capacità che la sola HBM non può superare. Colloca la memoria, non solo le GPU, come leva su quanto grandi e a quale costo possano essere serviti i modelli AI.