Google научила Gemini смотреть видео выборочно: токенов уходит до 88 % меньше
Google DeepMind добавила моделям Gemini агентное понимание видео. Вместо того чтобы прогонять ролик целиком с постоянной частотой кадров, модель теперь сама выбирает, какие куски записи посмотреть и в каком виде — расшифровкой, кадрами или звуком. Режим вышел 1 сентября и уже работает через Gemini API.
Час лекции стоил как книга
До сих пор Gemini разбирал видео в статическом режиме. Модель нарезала запись на кадры с частотой один кадр в секунду и загружала всё подряд, а звуковую дорожку считала отдельно, по 32 токена на секунду.
Арифметика получалась тяжёлой. Секунда видео в низком разрешении обходится примерно в 100 токенов, в высоком — около 300. Часовая лекция в низком качестве занимает под 360 тысяч токенов, а в высоком не помещается даже в контекстное окно на миллион.
Платить приходилось за всю запись целиком, включая заставку, паузы и статичный слайд, который висит на экране пятнадцать минут.
Модель сама решает, куда смотреть
Агентный режим ломает эту схему. Gemini получает ссылку на ролик и вопрос, после чего работает как агент с инструментом. Сначала модель обычно подтягивает текстовую расшифровку, дальше выборочно грузит нужные кадры или фрагменты звука, а на коротких отрезках с быстрым действием поднимает частоту кадров. Цикл повторяется, пока материала не хватит для ответа.
Считается это тоже по-новому. Рассуждения о том, куда смотреть дальше, идут как токены размышления, а сама подгрузка кусков ролика проходит по статье вызова инструмента.
Токенов меньше на 88 %
Замеры Google выглядят так:
- на длинных бенчмарках 1H-VideoQA и LVBench расход упал с 300–400 тысяч токенов на запрос до величины меньше 50 тысяч;
- на бенчмарке Minerva экономия составила 58 % и одновременно прибавилось 7 пунктов точности;
- по совокупности замеров расход токенов падает до 88 %, стоимость разбора — до 66 %.
Оговорка обязательная. Все цифры Google получила сама и на собственной методике, независимых проверок пока нет.
Gemini 3.7 Flash в верхней точке
Вокруг режима Google построила отдельное сравнение. На графике «точность против стоимости запроса» Gemini 3.7 Flash с агентным разбором уходит в левый верхний угол, обгоняя GPT-5 .6 Sol, GPT-5.6 Terra, Claude Opus 5 и Grok 4.6.
Модель для этой витрины выбрана удачно. Gemini 3.7 Flash вышла в середине августа и стоит по вводному тарифу 0,75 доллара за миллион входных токенов и 3,75 за миллион выходных. С 1 января 2027 года ставки удваиваются, так что нынешняя картинка по стоимости запроса продержится до конца года.
Площадка для сравнения тоже выбрана удобная. Разбор многочасового видео остаётся областью, где у Gemini исторически меньше всего сильных конкурентов.
Секунда, которую раньше пропускали
Gemini с агентным режимом закрывает четыре сценария, которые в статическом разборе шли плохо:
- поиск момента с точностью до долей секунды, который при одном кадре в секунду просто выпадал из выборки;
- вопрос по многочасовой записи, когда ответ спрятан в одном коротком эпизоде;
- поиск аномалии, где модель возвращается к подозрительному куску и пересматривает его чаще;
- подсчёт повторяющихся действий и объектов во времени.
Ранний доступ Google давала нескольким продуктовым командам, работающим с видео и синтезом речи. Публичных цифр по их сценариям компания не приводит.
Где включается режим
Агентное понимание видео уже работает в Google AI Studio и на Gemini Enterprise Agent Platform. Поддерживают его три модели — Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Источником может быть загруженный файл или публичная ссылка на YouTube.
Разработчику нужно поменять одно поле. В настройках видео параметр processing переводится в значение agentic, отдельной платы за режим нет, счёт идёт по обычным токенным тарифам.
В приложение Gemini функцию обещают выкатить в ближайшее время, а в «Ask YouTube» на страницах роликов — в течение нескольких месяцев.
Три часа на одно видео
Потолки у режима есть. Через файловый интерфейс модель с окном на миллион токенов берёт до трёх часов видео в низком разрешении и до часа в высоком, а запрос с вложенным файлом не должен превышать 100 мегабайт. На бесплатном тарифе Gemini API действует ограничение в восемь часов роликов с YouTube в сутки, на платном лимита по длине нет.
У самой идеи есть и обратная сторона. На клипах короче пяти минут агентный режим отвечает медленнее обычного, потому что модель сначала думает и ходит за кусками ролика и только потом начинает писать ответ. Для полутораминутной нарезки статический разбор остаётся быстрее.
Расшифровка, нарезка, конспект вебинара
Тем, кто работает с роликами руками, польза от режима считается прямо. Часовой вебинар теперь можно спросить о конкретной цифре из середины, не оплачивая прогон всей записи. Для нарезки коротких фрагментов пригодится поиск момента с точностью до долей секунды, а для конспекта стороннего разбора — выборочное чтение расшифровки.
Ограничение тоже практическое. На коротких роликах включать агентный режим Gemini смысла нет, выигрыш появляется примерно от десяти минут записи и растёт вместе с длиной.
Ask YouTube решит, сработало ли
В API режим выглядит убедительно, но проверять его будут в другом месте. Настоящая нагрузка начнётся, когда агентный разбор появится в приложении Gemini и в «Ask YouTube» на страницах роликов, где вопросы задают миллионы людей и безо всякой методики.
Пока у Google есть красивый график собственного производства и одно честное преимущество. Многочасовое видео остаётся территорией, куда конкуренты заходят неохотно, и обновление эту территорию за Gemini закрепляет.