A afirmação mais marcante do dia de tutorial da Hot Chips 38 em 23 de agosto veio da menor empresa a apresentar. A d-Matrix descreveu o Raptor, um acelerador de inferência em 3D-DRAM, e colocou sua densidade de largura de banda em cerca de 32,6 GB/s por mm2 contra aproximadamente 1,5 GB/s por mm2 para componentes HBM4 — um fator de cerca de vinte.
Os números de apoio
A energia por bit no caminho de E/S da 3D-DRAM é informada como 0,37 pJ/bit, contra 2,5-5 pJ para sistemas HBM4, e a potência como 2,96 mW por GB/s contra 40 mW para alternativas HBM. A capacidade é de 32GB por placa, com uma configuração de 72 placas descrita como capaz de hospedar modelos de fronteira em contexto de 1M e sustentar cerca de 1000 tokens por segundo por usuário em um modelo da classe 3T.
O gargalo ao qual se dirige
A Micron havia usado uma sessão adjacente para quantificar o problema. O throughput dos aceleradores cresce aproximadamente 3x a cada dois anos, enquanto a largura de banda da memória ligada em 2.5D, como a HBM, sobe a menos de 2x no mesmo período. A Micron também situou um pacote típico — GPU mais base die mais oito instâncias HBM4 — em mais de 12.000 mm2, com o silício de memória podendo exceder oito vezes a área do próprio die da GPU em HBM4 de 12 alturas. É esse o gap para o qual o Raptor está sendo apresentado.
O que a formulação comum entende errado
Todas as cifras acima são uma comparação de fornecedor apresentada pelo próprio fornecedor, em uma sessão de tutorial, sem produto em comercialização. A divulgação não traz data de lançamento, cronograma de disponibilidade nem cliente identificado. Uma proporção de 20x em uma métrica única não é um sistema 20x: densidade de largura de banda não diz nada sobre rendimento, custo por bit, comportamento térmico em um chassi real ou se a pilha de software existe. Comparações desse tipo são repetidamente tratadas como se fossem resultados de benchmark contra hardware já disponível. Não são — são alegações de arquitetura, e a postura correta é registrá-las e aguardar o silício.
Por que isso ainda importa
Porque os incumbentes concordaram com a premissa. Samsung, SK hynix e Micron dedicaram cada uma sua apresentação a alguma versão da mesma restrição, e o fato de uma desafiante conseguir propor uma topologia de memória fundamentalmente diferente e ainda obter espaço para defendê-la já é, por si só, o sinal.
