OpenAI выпустила GPT-Live - голосовую модель, которая слушает и говорит одновременно

8 июля OpenAI представила GPT-Live - новое поколение голосовых моделей для ChatGPT. Главное отличие от прежних версий: модель слушает и говорит одновременно, а не дожидается, пока собеседник замолчит. Функция уже заменяет старый голосовой режим ChatGPT для всех пользователей по всему миру на iOS, Android и в вебе.
OpenAI выпустила GPT-Live - голосовую модель, которая слушает и говорит одновременно

Голосом ChatGPT пользуются больше 150 млн человек в неделю. Его используют для бытовых вопросов, разговорной практики языка, сказок на ночь или просто чтобы поболтать по дороге на работу. Именно этому режиму OpenAI и меняет архитектуру.

Два прежних подхода к голосу

Первая версия голосового ChatGPT работала по каскадной схеме: одна модель переводила речь в текст, вторая формировала ответ, третья озвучивала его обратно. Схема рабочая, но медленная - на стыках терялась часть информации, а ответы звучали неестественно.

Advanced Voice Mode на GPT-4o убрал распознавание и синтез из отдельных шагов и обрабатывал звук одной моделью, что снизило задержку. Но разговор всё равно шёл по очереди: система ждала тишины, чтобы понять, что пользователь закончил фразу. Из-за этого случайная пауза или фоновый шум модель могла принять за конец реплики и невпопад перебить собеседника.

Full-duplex: слушает и говорит сразу

GPT-Live построена на full-duplex архитектуре - модель обрабатывает входящий звук и формирует ответ параллельно, а не по очереди. Несколько раз в секунду она решает: говорить, продолжать слушать, сделать паузу, перебить или обратиться к инструменту. По ходу разговора модель вставляет короткие реакции вроде «угу» или «понятно», показывая, что следит за мыслью собеседника, а если пользователь прервал её на полуслове - GPT-Live тут же перестраивает ответ.

OpenAI обещает, что случайная пауза больше не будет восприниматься как конец фразы: система стала точнее отличать раздумье от завершённой реплики и лучше выделяет голос на фоне посторонних звуков. Для запуска переозвучили все девять голосов ChatGPT.

Кто думает, пока модель говорит

Для сложных задач - поиска в интернете, многошагового рассуждения, работы с инструментами - GPT-Live передаёт запрос фронтир-модели (на старте это GPT-5.5) и продолжает разговор, пока та считает в фоне. Когда результат готов, GPT-Live возвращает его в беседу, не прерывая её паузой на обработку. Разговорная часть и «тяжёлое мышление» разделены - это позволяет OpenAI обновлять модель для сложных задач независимо от голосового слоя.

Отдельно система умеет работать синхронным переводчиком: собеседники говорят каждый на своём языке, и GPT-Live переводит с минимальной задержкой. Во время разговора ChatGPT также может показывать визуальные карточки - прогноз погоды, курсы акций, спортивные результаты, карты - прямо поверх голосового интерфейса.

Кому доступно и чего пока нет

GPT-Live выходит в двух версиях. GPT-Live-1 становится голосом по умолчанию для тарифов Go, Plus и Pro, GPT-Live-1 mini - для бесплатного плана. Разработчикам и корпоративным клиентам доступ к API обещают «скоро», пока можно только записаться в лист ожидания.

Есть и ограничения. На старте GPT-Live не работает с видео и демонстрацией экрана - для этих сценариев придётся вернуться к прежним Standard и Advanced Voice Mode, которые никуда не делись. Для части языков модель пока говорит с заметным акцентом или спотыкается на беглости - OpenAI признаёт это прямо и обещает донастройку.

Тесты против старой версии

По данным OpenAI, в парных сравнениях длинных разговоров (5–10 минут) пользователи заметно чаще предпочитали GPT-Live старому Advanced Voice Mode - по естественности, умению держать очередь реплик и реакции на перебивания. На GPQA, тесте экспертных научных рассуждений, GPT-Live обошла предшественника с большим отрывом. На BrowseComp, который проверяет агентный поиск сложно находимой информации, тоже заметный рост. На собственном внутреннем тесте телеком-поддержки τ³-Voice Telecom модель также опередила Advanced Voice Mode. Все цифры - из тестов самой OpenAI, независимого замера пока не было.

Защита для голосовых разговоров

Живой голос - риск другого рода, чем текстовый чат: реакция должна быть безопасной здесь и сейчас, а не после модерации задним числом. OpenAI расширила тесты именно под аудиоформат - с фокусом на самоповреждение, психоз и манию, эмоциональную привязанность к ИИ, насилие и сексуальный контент. Если система замечает потенциально небезопасный ответ прямо во время разговора, она может мягко перенаправить беседу, предложить ресурсы поддержки или в критичных случаях завершить разговор; для тем, связанных с самоповреждением, голосовой режим адаптировали под линии психологической помощи.

Отдельно прописаны ограничения для подростков через родительский контроль, а связанные с аккаунтом родители могут получать уведомления при признаках высокого риска. Голоса в GPT-Live - фиксированный набор, модель специально не умеет имитировать голос конкретного человека.

Google, Sesame и Hume уже рядом

Живой голосовой ИИ - не изобретение OpenAI в одиночку. Gemini Live у Google построен на похожем принципе нативной обработки звука с низкой задержкой и глубоко завязан на Workspace и Android. Стартап Sesame до недавнего времени многие называли самым «живым» голосовым ассистентом на рынке - компания сделала ставку именно на естественность речи. Hume AI пошла в другую сторону: её Empathic Voice Interface распознаёт больше 48 оттенков эмоций по интонации и дыханию, а не старается звучать по-человечески в целом.

GPT-Live выходит на поле, где естественность голоса уже не редкость - редкость связка живого разговора с полноценным фронтир-интеллектом в фоне. Насколько разница ощущается в реальном использовании, а не в демо на 5–10 минут, покажут ближайшие недели: OpenAI сама признаёт, что часть языков и сценариев ещё не дотянута.

22:35
201
Нет комментариев. Ваш будет первым!