Работа, поданная в 15:57 UTC 17 августа 2026 года Адамом Карвоненом, Юаном Онгом, Субхашем Кантамненни и Сэмюэлом Марксом, представляет CHIVE — Counterfactual Hypothesis Investigation Via Edits — агентный конвейер, который выявляет неожиданные модели поведения языковых моделей в реальных условиях и исследует их, изменяя промпт и наблюдая, что меняется. Главный результат — отрицательный, и он указывает на собственный инструментарий этой области.
Тест и результат
Авторы задают конкретный, поддающийся проверке вопрос: помогают ли распространённые методы интерпретируемости агенту предсказывать, как модель поведёт себя на связанных контрфактических входах? Они оценивают sparse autoencoders, natural-language autoencoders и activation oracles. Вывод, как сказано в аннотации: "Surprisingly, we find no uplift from any of the interpretability techniques studied." Сравнение проводится с агентом, который просто читает стенограмму разговора.
Что неверно в распространённой рамке
Очевидный заголовок — что sparse autoencoders мертвы. Это было бы преувеличением, и в работе такого утверждения нет. Формулировка уже и точнее: для этой задачи инструменты, основанные на активациях, не добавили ничего сверх того, что уже давало чтение стенограммы. Это утверждение о дополнительной информации поверх сильного текстового базового уровня, а не о том, соответствуют ли признаки SAE чему-то реальному внутри модели. Инструмент может описывать подлинную внутреннюю структуру и при этом не сообщать вам ничего, чего не видно в тексте.
Другая половина — полезная
Второе применение более конструктивно и получает меньше внимания. Авторы используют CHIVE для генерации обучающих данных и сообщают, что модели, обученные предсказывать результаты контрфактических экспериментов, сгенерированных CHIVE, обобщаются на распределения вне обучения. Так что конвейер, который дал отрицательный результат, одновременно дал и работающий метод — объяснение поведения оказывается обучаемым на основе контрфактических данных даже там, где чтение активаций не помогло.
Почему важен состав авторов
Интерпретируемость — главный технический столп, на который frontier labs ссылаются, когда их спрашивают, как будут контролироваться будущие системы. Два из четырёх авторов работают в команде по alignment в Anthropic. Лаборатория, публикующая взвешенный нулевой результат против собственной стратегической ставки, с конкретным бенчмарком, — более здоровый сигнал, чем очередная демонстрация возможностей, и он задаёт для области определение успеха, которому можно действительно предъявить требования: превзойти стенограмму.
