Samsung presentó su trabajo de procesamiento en memoria en Hot Chips, y el artículo publicado a primera hora del 29 de agosto pone cifras a ambos lados de la operación. La cifra de ancho de banda viajó; el coste arquitectónico, no.

Dónde está el ancho de banda

El gran multiplicador compara el ancho de banda disponible para las unidades de cómputo dentro del dispositivo de memoria con el ancho de banda que el mismo dispositivo expone a través de su interfaz externa. Ese es precisamente el objetivo de poner la computación en la memoria: el bus interno ancho es el recurso, y siempre estuvo ahí; lo que cambia es que ahora las unidades aritméticas se sitúan al lado cercano de ese bus. No se trata de ancho de banda adicional entregado al procesador anfitrión.

El coste que asume el anfitrión

Para que el esquema funcione, la memoria que contiene los operandos de PIM debe mapearse como no cacheable y no especulativa. Una copia en caché quedaría obsoleta en el momento en que la unidad en memoria escribiera sobre ella, y una lectura especulativa podría desencadenar un cómputo que, desde el punto de vista arquitectónico, nunca ocurrió. Así que el procesador que accede a esa región pierde la caché, pierde el prefetch por hardware y no puede reordenar esas accesos. Tres de los mecanismos que hacen rápidos a los núcleos modernos se desactivan precisamente para los datos que se están acelerando.

Lo que falla en el enfoque habitual

La cobertura ha tratado la cifra interna como una mejora a nivel de sistema, como si una máquina ganara ocho veces el ancho de banda de memoria. No es así. La afirmación correcta es más limitada y, aun así, interesante: para operaciones que están limitadas por el ancho de banda y son aritméticamente triviales, sobre todo el trabajo elemento a elemento y de reducción en la decodificación de LLM, mover la operación a los datos evita una ida y vuelta que de otro modo dominaría el bus externo. Para cualquier tarea intensiva en cómputo, PIM no es el lugar adecuado y la caché desactivada es una pérdida pura.

El rendimiento en contexto

La computación expuesta fuera de cada paquete equivale a un par de INT8 TOPS; un conjunto de ocho se sitúa en la franja baja de los dos dígitos de TOPS, comparable al NPU de un procesador de portátil convencional. La característica diferenciadora no es el rendimiento bruto, sino que ese rendimiento está vinculado a toda la capacidad de memoria de esos dispositivos, justo donde la decodificación de modelos grandes sufre de verdad.