Статья, загруженная на arXiv 20 августа, проверяет заявления о самоулучшении, делая то, чего такие работы обычно избегают: запускает контрольный прогон. Авторы сопоставили три раунда самообучения rank-32 LoRA на Qwen3-8B с замороженной моделью, пропущенной через идентичный конвейер, и выявили семь сбоев измерения, каждый из которых обращает заявленный результат вспять, если его контроль отсутствует. По словам авторов, несколько из них — это стандартная практика.

Ключевая цифра

Самоулучшение все чаще оценивают не по средней точности, а по тому, по каким отдельным задачам модель выигрывает и проигрывает, — подход, который требует вычитания двух шумных оценок. Таблица, построенная на одиночном greedy decode, создает изменения в возможностях у модели, которую вообще не обучали, в основном как артефакт батчинга при инференсе. А статистика расширения, используемая для отделения реального приобретения от простого уточнения, присваивает этой же необученной модели показатель 0.280. Метрика показывает значительное самоулучшение в системе, где по конструкции ничего подобного не происходило.

Что не так с распространенной рамкой

Результаты в этой литературе обычно подают как сравнение «до и после» на одной и той же модели, словно она сама себе служит контролем. Это не так. Между двумя измерениями стоят шум выборки, недетерминизм декодирования и эффекты батчинга, и все они порождают переходы по отдельным задачам без какого-либо обучения. Очевидное исправление — поднять порог так, чтобы исключить шум, — не выдерживает воспроизведения: если оценивать по замороженным сравнениям, которые уже есть в дизайне, нулевая гипотеза остается ненулевой. Авторы заменяют этот подход точным тестом по каждой задаче относительно объединенного базового уровня с контролем false-discovery rate.

Ограничения, о которых сказано честно

Речь идет об одной семейке моделей, на одном масштабе, с одним методом адаптации. Это не доказывает, что самоулучшение — иллюзия. Это показывает, что инструменты, обычно используемые для его обнаружения, фиксируют сильный сигнал в системе, которая не могла его породить, — а значит, опубликованным размерам эффекта нельзя доверять как превышающим порог измерения, потому что этот порог так и не был измерен.