Google научила Gemini смотреть видео выборочно: токенов уходит до 88 % меньше

Google DeepMind открыла для Gemini агентное понимание видео. Модель сама решает, какие фрагменты ролика посмотреть, вместо того чтобы прогонять запись целиком кадр за кадром. Компания обещает до 88 % экономии токенов и более точные ответы на длинных видео.
Google научила Gemini смотреть видео выборочно: токенов уходит до 88 % меньше

Google DeepMind добавила моделям Gemini агентное понимание видео. Вместо того чтобы прогонять ролик целиком с постоянной частотой кадров, модель теперь сама выбирает, какие куски записи посмотреть и в каком виде — расшифровкой, кадрами или звуком. Режим вышел 1 сентября и уже работает через Gemini API.

Час лекции стоил как книга

До сих пор Gemini разбирал видео в статическом режиме. Модель нарезала запись на кадры с частотой один кадр в секунду и загружала всё подряд, а звуковую дорожку считала отдельно, по 32 токена на секунду.

Арифметика получалась тяжёлой. Секунда видео в низком разрешении обходится примерно в 100 токенов, в высоком — около 300. Часовая лекция в низком качестве занимает под 360 тысяч токенов, а в высоком не помещается даже в контекстное окно на миллион.

Платить приходилось за всю запись целиком, включая заставку, паузы и статичный слайд, который висит на экране пятнадцать минут.

Модель сама решает, куда смотреть

Агентный режим ломает эту схему. Gemini получает ссылку на ролик и вопрос, после чего работает как агент с инструментом. Сначала модель обычно подтягивает текстовую расшифровку, дальше выборочно грузит нужные кадры или фрагменты звука, а на коротких отрезках с быстрым действием поднимает частоту кадров. Цикл повторяется, пока материала не хватит для ответа.

Считается это тоже по-новому. Рассуждения о том, куда смотреть дальше, идут как токены размышления, а сама подгрузка кусков ролика проходит по статье вызова инструмента.

Токенов меньше на 88 %

Замеры Google выглядят так:

  • на длинных бенчмарках 1H-VideoQA и LVBench расход упал с 300–400 тысяч токенов на запрос до величины меньше 50 тысяч;
  • на бенчмарке Minerva экономия составила 58 % и одновременно прибавилось 7 пунктов точности;
  • по совокупности замеров расход токенов падает до 88 %, стоимость разбора — до 66 %.

Оговорка обязательная. Все цифры Google получила сама и на собственной методике, независимых проверок пока нет.

Gemini 3.7 Flash в верхней точке

Вокруг режима Google построила отдельное сравнение. На графике «точность против стоимости запроса» Gemini 3.7 Flash с агентным разбором уходит в левый верхний угол, обгоняя GPT-5 .6 Sol, GPT-5.6 Terra, Claude Opus 5 и Grok 4.6.

Модель для этой витрины выбрана удачно. Gemini 3.7 Flash вышла в середине августа и стоит по вводному тарифу 0,75 доллара за миллион входных токенов и 3,75 за миллион выходных. С 1 января 2027 года ставки удваиваются, так что нынешняя картинка по стоимости запроса продержится до конца года.

Площадка для сравнения тоже выбрана удобная. Разбор многочасового видео остаётся областью, где у Gemini исторически меньше всего сильных конкурентов.

Секунда, которую раньше пропускали

Gemini с агентным режимом закрывает четыре сценария, которые в статическом разборе шли плохо:

  • поиск момента с точностью до долей секунды, который при одном кадре в секунду просто выпадал из выборки;
  • вопрос по многочасовой записи, когда ответ спрятан в одном коротком эпизоде;
  • поиск аномалии, где модель возвращается к подозрительному куску и пересматривает его чаще;
  • подсчёт повторяющихся действий и объектов во времени.

Ранний доступ Google давала нескольким продуктовым командам, работающим с видео и синтезом речи. Публичных цифр по их сценариям компания не приводит.

Где включается режим

Агентное понимание видео уже работает в Google AI Studio и на Gemini Enterprise Agent Platform. Поддерживают его три модели — Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Источником может быть загруженный файл или публичная ссылка на YouTube.

Разработчику нужно поменять одно поле. В настройках видео параметр processing переводится в значение agentic, отдельной платы за режим нет, счёт идёт по обычным токенным тарифам.

В приложение Gemini функцию обещают выкатить в ближайшее время, а в «Ask YouTube» на страницах роликов — в течение нескольких месяцев.

Три часа на одно видео

Потолки у режима есть. Через файловый интерфейс модель с окном на миллион токенов берёт до трёх часов видео в низком разрешении и до часа в высоком, а запрос с вложенным файлом не должен превышать 100 мегабайт. На бесплатном тарифе Gemini API действует ограничение в восемь часов роликов с YouTube в сутки, на платном лимита по длине нет.

У самой идеи есть и обратная сторона. На клипах короче пяти минут агентный режим отвечает медленнее обычного, потому что модель сначала думает и ходит за кусками ролика и только потом начинает писать ответ. Для полутораминутной нарезки статический разбор остаётся быстрее.

Расшифровка, нарезка, конспект вебинара

Тем, кто работает с роликами руками, польза от режима считается прямо. Часовой вебинар теперь можно спросить о конкретной цифре из середины, не оплачивая прогон всей записи. Для нарезки коротких фрагментов пригодится поиск момента с точностью до долей секунды, а для конспекта стороннего разбора — выборочное чтение расшифровки.

Ограничение тоже практическое. На коротких роликах включать агентный режим Gemini смысла нет, выигрыш появляется примерно от десяти минут записи и растёт вместе с длиной.

Ask YouTube решит, сработало ли

В API режим выглядит убедительно, но проверять его будут в другом месте. Настоящая нагрузка начнётся, когда агентный разбор появится в приложении Gemini и в «Ask YouTube» на страницах роликов, где вопросы задают миллионы людей и безо всякой методики.

Пока у Google есть красивый график собственного производства и одно честное преимущество. Многочасовое видео остаётся территорией, куда конкуренты заходят неохотно, и обновление эту территорию за Gemini закрепляет.

09:45
61
Нет комментариев. Ваш будет первым!