Google представила агентное понимание видео для Gemini 1 сентября, заявив, что оно снижает затраты на анализ до 66% и потребление токенов до 88%, одновременно повышая точность до 7%. Эта функция включается установкой processing в agentic в конфигурации API и доступна по стандартным тарифам токенов Gemini API без дополнительной платы за функцию.
Что неверно в распространенной трактовке
Сокращение числа токенов на 88% выглядит как прорыв в сжатии внутри модели. Это не так. В agentic-режиме Gemini сама выбирает какие моменты запрашивать, с какой частотой кадров и использовать ли кадры, аудио или транскрипт, вместо прежнего сэмплирования кадров с фиксированной частотой. Модель просто смотрит меньше видео. Это реальная и полезная возможность, но ее предел задается собственным суждением модели о том, что можно пропустить: если в задаче нужные доказательства разнесены тонким слоем по всей длительности ролика, пропускать нечего, и экономия исчезает.
Разрыв между двумя из показателей
Обратите внимание, что экономия на затратах (66%) заметно меньше, чем экономия на токенах (88%). Разница — это сам agentic-цикл: решение о том, что смотреть, тоже требует токенов. Все три показателя сформулированы как «до», то есть обозначают потолок, а не ожидаемый результат.
Где это действительно работает
Вторая ошибка в трактовке — в вопросе доступности. Функция вышла только в линейке Flash — Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite — и только через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. В приложении Gemini она появится «скоро», а в YouTube «Ask YouTube» — «в ближайшие месяцы». Во многих публикациях запуск иллюстрировали потребительским приложением, которого у функции на самом деле нет.
Почему выбор цены — это сигнал
Google утверждает, что Gemini 3.7 Flash «достигает фронтира Парето по соотношению точности и стоимости среди протестированных моделей», и не берет ничего дополнительно за этот режим. Видео долго оставалось форматом, в котором длинный контекст переставал быть важным, потому что фиксированная частота кадров делала стоимость зависимой от длительности, а не от насыщенности информацией. Разорвать эту связь и затем отказаться брать за это отдельную плату — значит попытаться сделать анализ длинных видео не нишевой, а обычной задачей.
