三星在 Hot Chips 上展示了其处理内存(processing-in-memory)工作,而 8 月 29 日凌晨发布的报道把这场权衡的两面都量化了。带宽数字被广泛传播,架构代价却没有。
带宽究竟在哪里
这个大倍率比较的是内存器件内部可供计算单元使用的带宽与同一器件通过外部接口暴露的带宽。把计算放进内存里的全部意义就在于此:更宽的内部总线本来就是资源,而这一直都存在——变化的是,算术单元如今被放到了它的近侧。它并不是给主处理器带来了额外带宽。
主机要付出的代价
要让这一方案成立,存放 PIM 操作数的内存必须映射为不可缓存且不可推测。只要内存内单元写入,缓存副本就会立刻过时;而一次推测性读取又可能触发一项在架构上根本没有发生过的计算。因此,访问该区域的处理器会失去缓存,失去硬件预取,也无法围绕这些访问进行重排序。现代核心之所以快的三项机制,恰恰会在这些被加速的数据上被关闭。
常见表述哪里说错了
相关报道一直把这项内部带宽数字当作系统级提速——仿佛一台机器获得了 8 倍内存带宽。事实并非如此。更准确、也仍然有意义的说法是:对于受带宽限制且算术运算极其简单的操作,主要是 LLM 解码中的逐元素与归约工作,把运算移到数据所在之处,可以避免一次原本会被外部总线主导的往返。对任何计算密集型任务来说,PIM 都不是合适的位置,而被禁用的缓存则纯属损失。
把吞吐量放到背景中看
单个封装对外暴露的计算能力只有几 INT8 TOPS;8 颗加起来可达到个位数十 TOPS,和主流笔记本处理器中的 NPU 相当。其区别不在于原始吞吐量,而在于这些吞吐量连接的是这些器件的全部内存容量,而这正是大模型解码最吃力的地方。
