Статья, опубликованная 21 August в Genome Biology и находящаяся в полностью открытом доступе, представляет фреймворк для объяснения логики предсказаний моделей сплайсинга РНК на основе глубокого обучения через интерпретируемую дистилляцию — обучение прозрачной модели воспроизводить поведение непрозрачной, а затем анализ прозрачной модели. Применённый к современным предикторам сплайсинга, он показывает, что они "страдают от повсеместных конфаундеров и слепых зон."

Что в действительности делают модели

Три вывода. Модели сплайсинга распознают экзоны через удивительно простые аддитивные комбинации последовательностных мотивов, включая известные регуляторные элементы сплайсинга, — механизм куда проще, чем подсказывает их архитектура. Они используют геномные конфаундеры, не связанные со сплайсингом. И они не способны должным образом учитывать эффекты структуры РНК, которая является реальным механизмом регуляции сплайсинга, а не краевым случаем. Следствие — систематические ошибки предсказания и ухудшение качества на нереференсных последовательностях.

Что не так с распространённой трактовкой

"State-of-the-art performance" — это именно то, что атакует эта статья, причём атака направлена на бенчмарк, а не на таблицу лидеров. Бенчмарки в этой области в значительной степени строятся на референсных последовательностях. Модели выучили обходные пути, которые проходят этот бенчмарк и ломаются на нереференсных последовательностях которые реально несут пациенты. Высокая точность на отложенной выборке читается как механистическое понимание сплайсинга, но это не так — это лишь свидетельство того, что модель нашла что-то предсказательное в обучающем распределении, и это что-то может быть, а может и не быть сплайсингом. Это shortcut learning, показанный на уровне механизма, а не просто утверждённый.

Почему это не академический спор

Предикторы сплайсинга такого класса — не любопытная экзотика. Их оценки используют для сортировки вариантов неопределённой значимости в клинической генетике — при решении, способен ли генетический вариант, обнаруженный у пациента, нарушить работу гена. Модель, которая показывает хорошие результаты на референсной последовательности и деградирует на нереференсной, ошибается именно в той популяции, где её и применяют.

Что здесь не количественно оценено

В аннотации выводы изложены качественно; величины эффектов приведены в полном тексте, и в этой статье их масштаб не утверждается. Самый дальний по значимости вклад — метод: фреймворк, который другие группы могут повторно применить к своим моделям, чтобы увидеть, на что именно эти модели опираются. Авторы трактуют результаты как прояснение фундаментальных ограничений обучения на геномных последовательностях и предлагают пути их преодоления.