La afirmación más llamativa de la jornada de tutoriales de Hot Chips 38 el 23 de agosto llegó de la empresa más pequeña entre las presentadoras. d-Matrix describió Raptor, un acelerador de inferencia 3D-DRAM, y situó su densidad de ancho de banda en unos 32,6 GB/s por mm2, frente a aproximadamente 1,5 GB/s por mm2 para los dispositivos HBM4, una diferencia de alrededor de veinte veces.
Las cifras que lo respaldan
La energía por bit en la ruta de E/S de 3D-DRAM se sitúa en 0,37 pJ/bit, frente a 2,5-5 pJ para los sistemas HBM4, y la potencia en 2,96 mW por GB/s frente a 40 mW para las alternativas HBM. La capacidad es de 32 GB por tarjeta, con una configuración de 72 tarjetas descrita como capaz de alojar modelos frontera con contexto de 1M y sostener alrededor de 1000 tokens por segundo por usuario en un modelo de clase 3T.
El muro al que apunta
Micron había utilizado una sesión adyacente para cuantificar el problema. El rendimiento de los aceleradores crece aproximadamente 3x cada dos años, mientras que el ancho de banda de la memoria acoplada en 2.5D, como HBM, aumenta a menos de 2x en el mismo periodo. Micron también situó un paquete típico —GPU más base die más ocho instancias HBM4— en más de 12.000 mm2, con silicio de memoria capaz de superar ocho veces el área del propio die de la GPU en HBM4 de 12 niveles. Ese es el hueco en el que se presenta Raptor.
Lo que falla en el marco habitual
Todas las cifras anteriores son una comparación del proveedor, presentada por el proveedor, en una sesión de tutorial, sin un producto comercial asociado. La divulgación no incluye fecha de lanzamiento, calendario de disponibilidad ni cliente identificado. Una relación 20x en una sola métrica no equivale a un sistema 20x: la densidad de ancho de banda no dice nada sobre el rendimiento de fabricación, el coste por bit, el comportamiento térmico en un chasis real o si existe la pila de software. Este tipo de comparaciones se repiten a menudo como si fueran resultados de benchmarking frente a hardware comercializado. No lo son: son afirmaciones arquitectónicas, y la postura correcta es registrarlas y esperar al silicio.
Por qué sigue importando
Porque los incumbentes aceptaron la premisa. Samsung, SK hynix y Micron dedicaron cada uno su turno a alguna versión de la misma restricción, y el hecho de que un aspirante pueda proponer una topología de memoria fundamentalmente distinta y obtener atención ya es, en sí mismo, una señal.
