Zachary Speck et Asa Shepard ont mis en ligne sur arXiv « Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training » à 17:46:08 UTC le 19 août. L’étude pose une question qui se discute habituellement à l’intuition : un document vu une seule fois reste-t-il en mémoire ?
L’expérience
32 modèles à l’échelle de GPT-2, avec 124 M de paramètres, entraînés sur OpenWebText — 24 expériences, quatre conditions sur huit graines. À l’étape d’entraînement 200 sur 9 536, un passage de 194 tokens a été injecté dans une seule ligne de lot, sous trois conditions (prose fluide avec un sujet réel ; prose fluide avec un sujet fabriqué ; caractères aléatoires) ainsi qu’un témoin sans injection.
Ce qui s’est passé
Cinquante étapes après l’injection, le modèle conservait un avantage mesurable sur ce passage : 0,039 à 0,044 nats de cross-entropy, significatif avec p < 10-4 dans huit cas sur huit. À l’étape finale de l’entraînement, l’effet avait disparu — p = 0,25, 0,71 et 0,54, avec une barrière de perte par interpolation à p = 0,509 et un cross-entropy sur données mises de côté à p = 0,310. Résumé des auteurs : « The passage is learned from one exposure and then decays. »
Ce que révèle le résultat sous-jacent
L’injection a déplacé les poids de 44,1 % de la distance euclidienne séparant des modèles initialisés par graines différentes, tout en produisant une barrière de perte équivalente à seulement 3,0 % de la barrière entre graines, avec 92 % de stabilisation à mi-parcours. Une large empreinte géométrique, presque aucune conséquence fonctionnelle. L’écart constitue un avertissement direct pour quiconque audite des modèles en mesurant les deltas de poids : la distance dans l’espace des poids est un mauvais proxy de ce qu’un modèle a appris.
Ce que le récit courant interprète mal
Deux lectures opposées sont toutes deux erronées. Il ne s’agit pas de dire que « des documents uniques sont mémorisés » — l’effet a disparu. Et il ne s’agit pas non plus de dire que « les données d’entraînement ne comptent pas » ou que « la mémorisation est un mythe », ce qui revient à aplatir un résultat nul lorsqu’il est agrégé. Ce que montre l’article est plus étroit et plus utile que l’une ou l’autre de ces interprétations. Il est aussi inévitablement vrai que GPT-2 à 124 M est quatre ordres de grandeur en dessous de l’échelle frontière, et qu’il s’agit d’un préprint sans relecture par les pairs. Rien ici n’autorise à affirmer si un modèle frontière retient ou non un document unique.
