Google выпустила Gemini 3.5 Transcribe: диктовка сама убирает «эм» и правит оговорки

Диктовка в Gboard теперь сама вычищает «эм» и «ага» и переписывает фразу, если человек передумал на полуслове. Google выпустила Gemini 3.5 Transcribe 26 августа — модель распознавания речи на 85+ языков, которая уже работает в Android, приложении Gemini на macOS и в API.
Google выпустила Gemini 3.5 Transcribe: диктовка сама убирает «эм» и правит оговорки

Gemini 3.5 Transcribe пришла на смену Chirp 3 , прежней модели распознавания речи Google. Команда Gemini Audio подаёт релиз как переход от расшифровки к диктовке начисто — сырой звук превращается сразу в отформатированный текст с абзацами и списками. Разработчикам модель открыли в предварительном доступе, обычные пользователи получили её внутри готовых продуктов.

«Встретимся во вторник - нет, в среду»

Эту фразу Google вынесла в анонс как образец работы умного режима. Gemini 3.5 Transcribe понимает, что человек передумал на полуслове, и оставляет в тексте только среду. Заодно вычищает «эм», «ага» и повторы, расставляет абзацы и списки.

На Android это работает через Rambler — новую функцию клавиатуры Gboard. Наговорил мысль как получилось, в поле осталась причёсанная версия. Голосом можно и править уже написанное: исправить опечатку, поменять имя, сменить тон формулировки.

В приложении Gemini на macOS модель работает уже голосовым командным интерфейсом. Она видит контекст экрана и передаёт тяжёлые задачи другим моделям Gemini — пересказать локальный файл, сгенерировать картинку прямо под курсором. Отдельно Google хвалится точностью на буквенно-цифровых кусках, где спотыкается любая диктовка. Номера заказов, почтовые индексы, артикулы.

Два режима - дословно и начисто

По умолчанию Gemini 3.5 Transcribe расшифровывает дословно, со всеми «эм» и оговорками. Чистка включается отдельным режимом, и развилка здесь разумная. Для интервью, протокола или юридической записи важно ровно то, что человек сказал. Причёсанная версия там становится проблемой.

Модель живёт в двух разных эндпоинтах. gemini-3.5-transcribe-live работает через Live API и держит непрерывный поток с задержкой меньше секунды, под голосовых ассистентов и субтитры в реальном времени. gemini-3.5-transcribe обрабатывает готовые записи через Interactions API, размечает реплики по говорящим и ставит тайминги на каждое слово.

Есть и собственный словарь — до тысячи терминов, которые модель будет писать так, как нужно вам. Для созвонов с фамилиями, названиями продуктов и внутренним жаргоном это самая полезная строчка в спецификации.

2,6% ошибок и пятая строчка в общем зачёте

Точность Google измеряет по данным Artificial Analysis. Средняя доля ошибочных слов у Gemini 3.5 Transcribe — 4,0% в потоковом режиме и 2,6% на готовых записях. На многоязычном наборе FLEURS цифры хуже, 5,50% и 5,04%. Время до финальной расшифровки против Chirp 3 сократилось на 70%.

Прирост относительно прошлого поколения выглядит убедительно, но формулировку «самая точная модель распознавания речи» Google применяет к своей линейке. В общем зачёте Artificial Analysis результат 2,6% даёт лишь пятое место. Рекорда рынка тут нет, есть аккуратный вход в первую пятёрку с сильной обвязкой вокруг ядра.

Чистый текст или разметка по спикерам, вместе не выйдет

Умный режим Gemini 3.5 Transcribe не сочетается с таймингами и диаризацией — разметкой записи по говорящим. Либо причёсанный текст, либо информация о том, кто и на какой секунде что сказал. Для интервью с последующей нарезкой цитат это неприятная развилка.

Дальше идут лимиты по длине. Обычный файл модель берёт до часа, с диаризацией или пословными таймингами потолок падает до получаса. Уверенно она разбирает трёх собеседников, всё что сверху Google помечает экспериментальным. Часовая планёрка на пять голосов пока вне зоны комфорта.

Цены в анонсе нет вообще. Ни прайса за минуту, ни примера расчёта — тарификация уходит в общую токенную сетку Gemini API, и посчитать по анонсу стоимость часа записи не получится.

Три двери в 3.5 Transcribe

Разработчикам Gemini 3.5 Transcribe открыли в публичном предварительном доступе через Gemini API в Google AI Studio и в среде Antigravity. Вход по обычному аккаунту Google, ни очереди, ни заявки. В AI Studio модель работает ещё и в режиме Build, где приложение собирается голосом.

Корпоративным клиентам её выдают через Gemini Enterprise Agent Platform, тоже в предварительном доступе. Несколько сторонних платформ для голосовых интерфейсов уже подключили модель через Live API, так что идти к Google напрямую не обязательно.

Обычному пользователю дверей меньше. Приложение Gemini на macOS понимает только английский, Rambler в Gboard раскатывают на часть стран и языков, диктовку в любое поле браузера Chrome обещают позже. Русского в подтверждённом списке нет, и это главная оговорка для читателя из России. Практический доступ сегодня идёт через API.

Расшифровка интервью и черновики голосом

У релиза два прикладных сценария для тех, кто каждый день пишет тексты. Надиктовка черновика стала быстрее, потому что Gemini 3.5 Transcribe отдаёт сразу структурированный текст и править его проще, чем расшифровку из старых движков. Второй сценарий — текстовые версии подкастов и вебинаров, где пословные тайминги дают готовую основу для таймкодов и субтитров.

Режимы под эти задачи разные. Цитаты собирают из дословной расшифровки, черновик берут из умного, а фамилии спикеров и названия продуктов заранее загоняют в словарь.

Chrome покажет, чего стоит заявка

Судить о модели по бенчмаркам смысла мало. Настоящая проверка начнётся в Chrome, когда диктовка появится в любом поле браузера и с ней разом столкнутся десятки миллионов человек. Пока же Gemini 3.5 Transcribe остаётся предварительным доступом для разработчиков и одной функцией клавиатуры на части Android-устройств.

И ещё одно. Умная расшифровка устроена так, что модель сама решает, что вы имели в виду. Дословный режим Google оставила по умолчанию именно поэтому, и переключать его стоит осознанно.

11:15
53
Нет комментариев. Ваш будет первым!