Статья, опубликованная 21 August в Genome Biology и находящаяся в полностью открытом доступе, представляет фреймворк для объяснения логики предсказаний моделей сплайсинга РНК на основе глубокого обучения через интерпретируемую дистилляцию — обучение прозрачной модели воспроизводить поведение непрозрачной, а затем анализ прозрачной модели. Применённый к современным предикторам сплайсинга, он показывает, что они "страдают от повсеместных конфаундеров и слепых зон."
Что в действительности делают модели
Три вывода. Модели сплайсинга распознают экзоны через удивительно простые аддитивные комбинации последовательностных мотивов, включая известные регуляторные элементы сплайсинга, — механизм куда проще, чем подсказывает их архитектура. Они используют геномные конфаундеры, не связанные со сплайсингом. И они не способны должным образом учитывать эффекты структуры РНК, которая является реальным механизмом регуляции сплайсинга, а не краевым случаем. Следствие — систематические ошибки предсказания и ухудшение качества на нереференсных последовательностях.
Что не так с распространённой трактовкой
"State-of-the-art performance" — это именно то, что атакует эта статья, причём атака направлена на бенчмарк, а не на таблицу лидеров. Бенчмарки в этой области в значительной степени строятся на референсных последовательностях. Модели выучили обходные пути, которые проходят этот бенчмарк и ломаются на нереференсных последовательностях которые реально несут пациенты. Высокая точность на отложенной выборке читается как механистическое понимание сплайсинга, но это не так — это лишь свидетельство того, что модель нашла что-то предсказательное в обучающем распределении, и это что-то может быть, а может и не быть сплайсингом. Это shortcut learning, показанный на уровне механизма, а не просто утверждённый.
Почему это не академический спор
Предикторы сплайсинга такого класса — не любопытная экзотика. Их оценки используют для сортировки вариантов неопределённой значимости в клинической генетике — при решении, способен ли генетический вариант, обнаруженный у пациента, нарушить работу гена. Модель, которая показывает хорошие результаты на референсной последовательности и деградирует на нереференсной, ошибается именно в той популяции, где её и применяют.
Что здесь не количественно оценено
В аннотации выводы изложены качественно; величины эффектов приведены в полном тексте, и в этой статье их масштаб не утверждается. Самый дальний по значимости вклад — метод: фреймворк, который другие группы могут повторно применить к своим моделям, чтобы увидеть, на что именно эти модели опираются. Авторы трактуют результаты как прояснение фундаментальных ограничений обучения на геномных последовательностях и предлагают пути их преодоления.
