Zachary Speck y Asa Shepard publicaron "Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training" en arXiv a las 17:46:08 UTC del 19 de agosto. Plantea una pregunta que suele debatirse desde la intuición: ¿un documento, visto una sola vez, se queda?
El experimento
32 modelos a escala de GPT-2 con 124M de parámetros entrenados sobre OpenWebText — 24 experimentos, cuatro condiciones a lo largo de ocho semillas. En el paso de entrenamiento 200 de 9.536 se inyectó un pasaje de 194 tokens en exactamente una fila del lote, bajo tres condiciones (prosa fluida con un sujeto real; prosa fluida con un sujeto inventado; caracteres aleatorios) más un control sin inyección.
Qué ocurrió
Cincuenta pasos después de la inyección, el modelo mantenía una ventaja mensurable sobre ese pasaje: 0.039 a 0.044 nats de entropía cruzada, significativa con p < 10-4 en ocho de ocho semillas. En el paso final del entrenamiento ya había desaparecido — p = 0.25, 0.71 y 0.54, con la barrera de pérdida por interpolación en p = 0.509 y la entropía cruzada fuera de muestra en p = 0.310. El propio resumen de los autores: "El pasaje se aprende a partir de una sola exposición y luego decae."
El hallazgo bajo el hallazgo
La inyección desplazó los pesos un 44.1% de la distancia euclídea entre modelos sembrados de forma independiente, al tiempo que produjo una barrera de pérdida de solo 3.0% de la barrera entre semillas, con un 92% de asentamiento en el punto medio. Una gran huella geométrica, casi ninguna consecuencia funcional. Esa brecha es una advertencia directa para quien audite modelos midiendo deltas de peso: la distancia en el espacio de pesos es un mal sustituto de lo que un modelo ha aprendido.
Lo que falla en la lectura habitual
Hay dos lecturas opuestas que son erróneas. No es "los documentos individuales se memorizan" — el efecto desapareció. Y tampoco es "los datos de entrenamiento no importan" o "la memorización es un mito", que es como se aplana un resultado nulo cuando se agrega. Lo que muestra el artículo es más estrecho y más útil que cualquiera de las dos interpretaciones. También es inevitablemente cierto que GPT-2 con 124M está cuatro órdenes de magnitud por debajo de la escala de frontera, y que se trata de un preprint sin revisión por pares. Nada de esto autoriza a afirmar si un modelo de frontera conserva un único documento.
