Samsung a présenté ses travaux de processing-in-memory à Hot Chips, et le compte rendu publié tôt le 29 août met des chiffres des deux côtés de l’équation. Le chiffre de bande passante a circulé ; le coût architectural, lui, non.
Où se trouve la bande passante
Le grand multiple compare la bande passante accessible aux unités de calcul à l’intérieur du composant mémoire à celle que le même composant expose via son interface externe. C’est tout l’intérêt de placer le calcul dans la mémoire : le large bus interne est la ressource, et il a toujours existé — ce qui change, c’est que les unités arithmétiques se trouvent désormais du côté proche de ce bus. Il ne s’agit pas d’une bande passante supplémentaire fournie au processeur hôte.
Le coût payé par l’hôte
Pour que le schéma fonctionne, la mémoire qui contient les opérandes du PIM doit être mappée comme non cacheable et non spéculative. Une copie en cache deviendrait obsolète dès que l’unité in-memory y écrirait, et une lecture spéculative pourrait déclencher un calcul qui, du point de vue architectural, n’a jamais eu lieu. Le processeur qui adresse cette zone perd donc le caching, perd le préchargement matériel, et ne peut pas réordonner ces accès. Trois des mécanismes qui rendent les cœurs modernes rapides sont désactivés pour précisément les données accélérées.
Ce que le cadrage courant ignore
Les reportages ont présenté le chiffre interne comme un gain au niveau du système — comme si une machine gagnait huit fois la bande passante mémoire. Ce n’est pas le cas. La bonne affirmation est plus étroite, mais reste intéressante : pour les opérations limitées par la bande passante et arithmétiquement triviales, principalement les traitements élémentaires et les réductions dans le decode des LLM, déplacer l’opération vers les données évite un aller-retour qu’autrement le bus externe dominerait. Pour tout ce qui est dense en calcul, le PIM n’est pas au bon endroit et le cache désactivé n’est qu’une perte nette.
Le débit replacé dans son contexte
Le calcul par boîtier exposé à l’extérieur représente quelques INT8 TOPS ; un ensemble de huit atteint des dizaines de TOPS à un chiffre unique — comparable au NPU d’un processeur d’ordinateur portable grand public. La différence ne tient pas au débit brut, mais au fait que ce débit est attaché à l’ensemble de la capacité mémoire de ces dispositifs, là où le decode des grands modèles fait réellement mal.
