Gemini 3.7 Flash обошёл прошлую версию по коду и подешевел вдвое

Google выпустила Gemini 3.7 Flash - недорогую модель для кода и ИИ-агентов, которая заметно обходит предыдущую версию на тестах по отладке, работе с документами и веб-разработке. Релиз состоялся 13 августа, через три недели после Gemini 3.6 Flash.
Gemini 3.7 Flash обошёл прошлую версию по коду и подешевел вдвое

Flash - средняя линейка Gemini , рабочая лошадка Google для задач, где важна не максимальная сила модели, а сочетание приемлемого качества, скорости и низкой цены. Именно на ней держится большинство сценариев с ИИ-агентами: разбор документов, автоматизация рутины, генерация кода пачками. Новую версию Google подаёт как ответ на обратную связь разработчиков и открывает сразу на всех своих площадках для сборки приложений.

Годовой отчёт превращается в страницу

Самый наглядный сценарий из тех, что Google показала вместе с релизом, - превращение статичного PDF в интерактивную веб-страницу. Модель разбирает годовой отчёт компании, вытаскивает из него цифры и собирает работающий сайт с живыми графиками и сведёнными выводами. В соседнем демо Gemini 3.7 Flash за один запрос собирает лендинг, раздавая часть работы вспомогательным моделям, а ещё в одном - генерирует играбельную 3D-игру, где персонажи и текстуры дорисовываются на лету.

Демонстрации подобраны под одну мысль - связку «текст на входе, готовый продукт на выходе». Ровно этого рынок сейчас и ждёт от дешёвых моделей. Результат, который можно показать заказчику, а не диалог в чате.

Рывок в отладке и коде

Основной прирост Gemini 3.7 Flash дала в разработке. Google приводит пять ключевых замеров в сравнении с версией 3.6:

  • FrontierCode 1.1 Main (качество продакшен-кода) - 43,6% против 34,4%;
  • DeepSWE v1.1 (долгие задачи по разработке) - 65,3% против 49,0%;
  • Code Arena (веб-разработка, рейтинг Elo) - 1588 против 1538;
  • GDP.pdf (разбор сложных документов) - 34,0% против 22,0%;
  • AutomationBench (автоматизация бизнес-процессов) - 30,4% против 17,0%.

Последняя цифра выглядит самой показательной. Рост почти вдвое на тесте, который проверяет умение доводить до конца реальные рабочие цепочки, объясняет, почему Google называет модель ориентированной на агентов. По части удержания длинного контекста модель тоже подтянулась - на тесте GDM-MRCR v2 со 128 тысячами токенов она достаёт нужные фрагменты в 97,0% случаев против 91,8% у предшественницы.

Технически это не новая архитектура. В карточке модели прямо сказано, что 3.7 Flash построена на 3.6 Flash и отличается доработкой ядра рассуждений. Окно контекста - миллион токенов на вход, до 64 тысяч на выход, на вход принимаются текст, картинки, аудио и видео.

Gemini 3.7 Flash

Цена вдвое ниже до января

Вводный тариф - 0,75 доллара за миллион входных токенов и 3,75 за миллион выходных. Столько же стоила и версия 3.6, но у неё это цена уже после снижения, а Google отсчитывает вдвое от её стартового прайса. Вводные условия действуют до 31 декабря 2026 года, с 1 января цена удваивается - 1,50 и 7,50 доллара соответственно.

Для сравнения, Claude Sonnet 5 обходится в 2 и 10 долларов, GPT-5 .6 Terra - в 2 и 12. То есть до Нового года Gemini 3.7 Flash стоит примерно втрое дешевле ближайших конкурентов своего класса, обгоняя их на части тестов по коду. После января разрыв сожмётся до полутора-двух раз, и вот тогда станет понятно, покупали модель за качество или за цену.

Где Flash проигрывает соперникам

Google охотно сравнивает 3.7 Flash с 3.6 Flash и заметно скромнее - с чужими моделями. Причина видна в той же таблице. На тесте GDPVal-AA, который оценивает качество экспертной офисной работы, Gemini набирает 1525 против 1598 у Claude Sonnet 5 и 1628 у Muse Spark 1.2. На агентных задачах внутри терминала и на управлении компьютером впереди GPT-5.6 Terra. По сводному индексу Artificial Analysis модель набирает 56 баллов при 57 у двух конкурентов - паритет, а не превосходство.

Есть и прямой откат. На тесте CharXiv, где нужно вытаскивать смысл из сложных графиков, 3.7 Flash показывает 84,5% против 85,2% у предыдущей версии. Разница в пределах погрешности, но направление обратное заявленному прогрессу.

Отдельная оговорка про знания модели. Обучающие данные обрезаны мартом 2026 года, а по части тем, как признаёт сама Google, свежесть остаётся на уровне января 2025-го. Для новостных и аналитических задач это ощутимо.

Обычным пользователям только через Spark

Разработчикам Gemini 3.7 Flash доступна через Gemini API в Google AI Studio, в Android Studio и в агентной среде Google Antigravity. Бизнесу - в Gemini Enterprise и на корпоративной платформе агентов. А вот в обычном приложении Gemini новая модель появилась только внутри Spark - персонального агента, который работает в фоне и выполняет поручения сам. Spark открыт подписчикам Google AI Pro и Ultra в 160 с лишним странах, но не в Евросоюзе, Швейцарии, Великобритании и Нигерии. России в списке поддерживаемых стран тоже нет, так что практический путь к модели здесь - сторонние агрегаторы моделей и доступ по API.

Внутри Spark обновление обещает более аккуратную работу с Google Workspace: сведение файлов, черновики писем, обновление статусных документов.

Фильтры CBRN и порог тревоги

Модель вышла с усиленными ограничителями по двум направлениям - химическое, биологическое, радиологическое и ядерное оружие и наступательные кибероперации. По собственной рамке безопасности Google ни один критический порог не пройден, но по обоим направлениям зафиксирован «порог тревоги» - уровень, после которого компания оставляет защитные механизмы включёнными на постоянной основе.

В той же карточке есть любопытная деталь. Gemini 3.7 Flash достаточно наблюдательна, чтобы понять, что её тестируют, и в этом она сильнее старшей Gemini 3.1 Pro. Обойти тестовые ограничения при этом не может.

«Модель прилежнее размышляет, вкладывая больше усилий в многошаговое планирование и вызовы инструментов. Более дисциплинированное исполнение сокращает ручной контроль и число повторных попыток»,

- пишет в блоге Google Тулси Доши, старший директор по продуктам.

Дешёвая лошадка для рутины сайта

Тем, кто гоняет модели пачками - прогон описаний товаров, разбор PDF-документов, сборка простых лендингов, - до конца года открывается окно с низкой ценой при выросшем качестве кода. Разумно перевести на 3.7 Flash именно объёмную рутину, оставив сложные тексты и аналитику на старших моделях. Заодно стоит зафиксировать в расчётах, что с января счёт за те же объёмы вырастет ровно вдвое.

Старшая линейка Gemini буксует

За три недели Google дважды обновила среднюю линейку, а обещанного Gemini 3.5 Pro так и нет. Компания судьбу этой версии не комментирует, но говорит, что уже обучает Gemini 4 и довольна ранними результатами, - похоже, 3.5 Pro просто пропустят. Пока конкуренция на фронтире идёт между Anthropic и OpenAI , Google уверенно занимает нишу «достаточно умно и очень дёшево». Продержится ли она в этой нише после 1 января, когда цена удвоится, покажет первый же квартал 2027 года.

12:00
49
Нет комментариев. Ваш будет первым!