Zachary Speck e Asa Shepard publicaram "Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training" no arXiv às 17:46:08 UTC de 19 de agosto. O trabalho faz uma pergunta que normalmente é debatida na base da intuição: um documento, visto uma única vez, fica?

O experimento

32 modelos em escala de GPT-2, com 124 milhões de parâmetros, foram treinados no OpenWebText — 24 experimentos, quatro condições em oito sementes. Na etapa 200 de 9.536 do treinamento, uma passagem de 194 tokens foi injetada exatamente em uma linha de um lote, sob três condições (prosa fluente com um sujeito real; prosa fluente com um sujeito fabricado; caracteres aleatórios), além de um controle sem injeção.

O que aconteceu

Cinquenta etapas após a injeção, o modelo mantinha uma vantagem mensurável sobre essa passagem: 0,039 a 0,044 nats de cross-entropy, significativa com p < 10-4 em oito de oito sementes. Na etapa final do treinamento, isso havia desaparecido — p = 0,25, 0,71 e 0,54, com a barreira de perda por interpolação em p = 0,509 e a cross-entropy no conjunto de validação em p = 0,310. O resumo dos autores: "A passagem é aprendida após uma única exposição e depois decai."

O achado por trás do achado

A injeção deslocou os pesos em 44,1% da distância euclidiana entre modelos com sementes independentes, ao mesmo tempo em que produziu uma barreira de perda de apenas 3,0% da barreira entre sementes, com assentamento de 92% no ponto médio. Uma grande marca geométrica, quase nenhuma consequência funcional. Essa diferença é um alerta direto para quem audita modelos medindo deltas de peso: a distância no espaço dos pesos é um mau proxy para o que um modelo aprendeu.

O que a narrativa comum interpreta errado

Duas leituras opostas estão erradas. Não se trata de "documentos únicos são memorizados" — o efeito desapareceu. E também não é "os dados de treinamento não importam" ou "memorização é um mito", como acontece quando um resultado nulo é achatado à medida que é agregado. O que o artigo mostra é mais estreito e mais útil do que qualquer uma dessas leituras. Também é inevitavelmente সত্য que o GPT-2 com 124 milhões de parâmetros está quatro ordens de magnitude abaixo da escala de fronteira, e este é um preprint sem revisão por pares. Nada aqui autoriza afirmar se um modelo de fronteira retém um único documento.