Google выпустила две модели синтеза речи

Google представила две модели генерации речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые называет самыми выразительными среди своих аудиомоделей. Обе выходят 23 сентября 2026 года. Чем различаются две новинки Модели относятся к семейству
Google выпустила две модели синтеза речи

Google представила две модели генерации речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые называет самыми выразительными среди своих аудиомоделей. Обе выходят 23 сентября 2026 года.

Чем различаются две новинки

Модели относятся к семейству Gemini Audio и продолжают линейку, в которой уже вышли 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Разница между новинками — в назначении. Gemini 3.8 Flash TTS рассчитана на творческую работу: создание голосов персонажей и построчную режиссуру сцен. Gemini 3.8 Flash-Lite TTS оптимизирована под большие объёмы и экономию — массовый дубляж, производство аудиоконтента и голосовые агенты.

Голоса с нуля и по образцу

Flash TTS позволяет создавать голоса с чистого листа через обычные текстовые запросы: задаются роль, акцент и характеристики голоса более чем на 100 языках и диалектах. В библиотеке доступно свыше 2000 готовых голосов, включая региональные варианты — мексиканский испанский, квебекский французский, шотландский английский. Отдельно заявлено клонирование голоса по 30-секундному образцу — своему или тому, на который у пользователя есть права. Созданные голоса можно сохранять и переиспользовать, чтобы звучание не менялось от проекта к проекту. Функция ремикширования голоса — тонкой настройки тембра, высоты, темпа и акцента — пока заявлена как «скоро».

Режиссура по строкам и сцены на двоих

Обе модели дают построчное управление подачей: темп, эмоции, смена диалекта, ремарки вроде смеха, вздоха или коротких поддакиваний для естественности диалога. Есть нативная постановка сцен с двумя говорящими из одного сценария — с раздельными голосами и естественной сменой реплик. Для длинных форматов заявлено сохранение качества и тембра на протяжении часов аудио с минимальным дрейфом голоса, что важно для подкастов и аудиокниг.

Цифры и сравнение с конкурентами

Flash TTS заняла первое место в общем зачёте бенчмарка Voice Design от Hume AI с результатом 71,4, а также лидирует в моделировании акцентов с 60,8. В индексе Overall Quality Index того же Hume AI модели заняли первое и второе места. В слепых оценках человеческих предпочтений на Voice Arena обе модели вошли в топ среди конкурентов по ряду языков, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди. По сравнению с Gemini 3.1 Flash TTS заявлены заметные улучшения в длинном контенте и управлении диалогом двух говорящих.

Кому и когда доступно

Flash TTS доступна разработчикам в Gemini API и Google AI Studio, всем пользователям — в Gemini Notebook; для бизнеса появится «скоро» через API в Gemini Enterprise. Flash-Lite TTS доступна разработчикам там же, а всем пользователям — в Google Vids, для предприятий тоже «скоро» в Gemini Enterprise. В Google AI Studio открыта площадка для работы со звуком: можно создать голос с нуля или клонировать свой и перенести его в редактор сценариев для двух говорящих. Среди партнёров, уже встраивающих модели, названы Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang; среди платформ для развёртывания — Agora, LiveKit, Pipecat и Vercel.

Защита от подделок

Для клонирования голоса требуется запись устного согласия владельца голоса, совпадающая с эталонным образцом. Каждый сгенерированный фрагмент помечается невоспринимаемым водяным знаком SynthID, а также снабжается учётными данными C2PA — чтобы синтезированную речь можно было распознать и снизить риск дезинформации.

На что смотреть при проверке

Заявленные первые места опираются на бенчмарки и слепые оценки самой Hume AI, а не на независимые замеры, поэтому лидерство стоит проверять на собственных задачах. Ключевые обещания — стабильность голоса на часах аудио и клонирование по 30 секундам — удобнее всего тестировать именно на длинных записях и на языках с редкими диалектами, где обычно и проявляется дрейф тембра.

Первоисточник: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

22:14
19
Нет комментариев. Ваш будет первым!