Google представила агентное понимание видео для Gemini 1 сентября, заявив, что оно снижает затраты на анализ до 66% и потребление токенов до 88%, одновременно повышая точность до 7%. Эта функция включается установкой processing в agentic в конфигурации API и доступна по стандартным тарифам токенов Gemini API без дополнительной платы за функцию.

Что неверно в распространенной трактовке

Сокращение числа токенов на 88% выглядит как прорыв в сжатии внутри модели. Это не так. В agentic-режиме Gemini сама выбирает какие моменты запрашивать, с какой частотой кадров и использовать ли кадры, аудио или транскрипт, вместо прежнего сэмплирования кадров с фиксированной частотой. Модель просто смотрит меньше видео. Это реальная и полезная возможность, но ее предел задается собственным суждением модели о том, что можно пропустить: если в задаче нужные доказательства разнесены тонким слоем по всей длительности ролика, пропускать нечего, и экономия исчезает.

Разрыв между двумя из показателей

Обратите внимание, что экономия на затратах (66%) заметно меньше, чем экономия на токенах (88%). Разница — это сам agentic-цикл: решение о том, что смотреть, тоже требует токенов. Все три показателя сформулированы как «до», то есть обозначают потолок, а не ожидаемый результат.

Где это действительно работает

Вторая ошибка в трактовке — в вопросе доступности. Функция вышла только в линейке Flash — Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite — и только через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. В приложении Gemini она появится «скоро», а в YouTube «Ask YouTube» — «в ближайшие месяцы». Во многих публикациях запуск иллюстрировали потребительским приложением, которого у функции на самом деле нет.

Почему выбор цены — это сигнал

Google утверждает, что Gemini 3.7 Flash «достигает фронтира Парето по соотношению точности и стоимости среди протестированных моделей», и не берет ничего дополнительно за этот режим. Видео долго оставалось форматом, в котором длинный контекст переставал быть важным, потому что фиксированная частота кадров делала стоимость зависимой от длительности, а не от насыщенности информацией. Разорвать эту связь и затем отказаться брать за это отдельную плату — значит попытаться сделать анализ длинных видео не нишевой, а обычной задачей.