Zachary Speck e Asa Shepard hanno pubblicato su arXiv alle 17:46:08 UTC del 19 agosto "Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training". Il lavoro pone una domanda che di solito viene discussa per intuizione: un documento, visto una sola volta, resta?

L'esperimento

32 modelli in scala GPT-2 da 124M di parametri addestrati su OpenWebText — 24 esperimenti, quattro condizioni su otto seed. Al training step 200 su 9.536, un passaggio di 194 token è stato inserito in esattamente una riga del batch, in tre condizioni (prosa fluente con un soggetto reale; prosa fluente con un soggetto inventato; caratteri casuali) più un controllo senza inserimento.

Cosa è successo

Cinquanta step dopo l'inserimento, il modello mostrava un vantaggio misurabile su quel passaggio: 0,039-0,044 nats di cross-entropy, significativo con p < 10-4 in otto su otto seed. All'ultimo step di addestramento era scomparso — p = 0,25, 0,71 e 0,54, con la barriera di perdita per interpolazione a p = 0,509 e la cross-entropy sul held-out a p = 0,310. Il riassunto degli autori: "Il passaggio viene appreso con una sola esposizione e poi decade."

Il risultato sotto il risultato

L'inserimento ha spostato i pesi del 44,1% della distanza euclidea tra modelli inizializzati in modo indipendente, producendo però una barriera di perdita pari soltanto al 3,0% della barriera seed-to-seed, con un assestamento del 92% entro il punto medio. Una grande impronta geometrica, con quasi nessuna conseguenza funzionale. Quel divario è un avvertimento diretto per chi valuta i modelli misurando i delta dei pesi: la distanza nello spazio dei pesi è un cattivo proxy di ciò che un modello ha appreso.

Cosa sbaglia la lettura più comune

Ci sono due letture opposte, entrambe sbagliate. Non è "i singoli documenti vengono memorizzati" — l'effetto è svanito. E non è "i dati di addestramento non contano" o "la memorizzazione è un mito", che è il modo in cui un risultato nullo viene appiattito quando viene aggregato. Ciò che il paper mostra è più ristretto e più utile di entrambe. È anche inevitabilmente vero che GPT-2 a 124M è quattro ordini di grandezza sotto la scala frontier, e questo è un preprint senza revisione paritaria. Nulla di tutto ciò autorizza a sostenere che un modello frontier conservi un singolo documento.