Samsung и SK Hynix выводят на коммерческий рынок новый класс памяти, делая ставку на то, что AI-инференс перерастает дорогую высокоскоростную память HBM, размещаемую рядом с GPU. Технология Compute Express Link (CXL) добавляет уровень между обычной DRAM и более медленным SSD-накопителем — способ дать AI-системам гораздо больший адресуемый объем памяти, не полагаясь только на дефицитную и дорогую HBM.

Что меняет CXL

Крупным моделям нужно держать огромные массивы параметров и контекст рядом с процессором. HBM быстрая, но ограничена по емкости и поставкам; системная DRAM дешевле, но ее объем ограничен тем, сколько сервер физически может вместить. CXL позволяет объединять и совместно использовать память между устройствами через высокоскоростное соединение, расширяя эффективный объем памяти, к которому может обращаться GPU, — что напрямую важно для обслуживания крупных моделей в масштабе.

Демонстрации

SK Hynix показала модуль второго поколения 256GB CMM-DDR5 на CXL 3.2, а ее исследователи сообщили о росте пропускной способности до 35.7% в задачах инференса. Samsung протестировала пул памяти 1TB CXL, который достигал примерно 92% производительности инференса на уровне DRAM на восьми GPU — достаточно близко к полной скорости памяти, чтобы использоваться в продакшене, при этом добавляя гораздо большую емкость.

Сроки и зависимости

Samsung нацелена на производство своего модуля CMM-D к концу 2026 года, хотя запуск может сдвинуться на 2027 год, поскольку внедрение CXL зависит от задержавшихся серверных платформ Intel и AMD, поддерживающих этот стандарт. Аналитик Eugene Investment & Securities Им Со-джон сказала, что CXL «действительно выходит на первый план с 2026 года», а массовые серверы с поддержкой CXL появятся к 2028 году.

Второй фронт в войне за память

Для корейских гигантов CXL — это способ продавать больше памяти в AI-системы помимо HBM, в котором они уже доминируют, а также способ преодолеть потолок емкости, который HBM в одиночку снять не может. Это позиционирует память, а не только GPU, как рычаг, определяющий, насколько крупные AI-модели можно обслуживать и насколько дешево это делать.