OpenAI выпустила GPT-Live - голосовую модель, которая слушает и говорит одновременно

Голосом ChatGPT пользуются больше 150 млн человек в неделю. Его используют для бытовых вопросов, разговорной практики языка, сказок на ночь или просто чтобы поболтать по дороге на работу. Именно этому режиму OpenAI и меняет архитектуру.
Два прежних подхода к голосу
Первая версия голосового ChatGPT работала по каскадной схеме: одна модель переводила речь в текст, вторая формировала ответ, третья озвучивала его обратно. Схема рабочая, но медленная - на стыках терялась часть информации, а ответы звучали неестественно.
Advanced Voice Mode на GPT-4o убрал распознавание и синтез из отдельных шагов и обрабатывал звук одной моделью, что снизило задержку. Но разговор всё равно шёл по очереди: система ждала тишины, чтобы понять, что пользователь закончил фразу. Из-за этого случайная пауза или фоновый шум модель могла принять за конец реплики и невпопад перебить собеседника.
Full-duplex: слушает и говорит сразу
GPT-Live построена на full-duplex архитектуре - модель обрабатывает входящий звук и формирует ответ параллельно, а не по очереди. Несколько раз в секунду она решает: говорить, продолжать слушать, сделать паузу, перебить или обратиться к инструменту. По ходу разговора модель вставляет короткие реакции вроде «угу» или «понятно», показывая, что следит за мыслью собеседника, а если пользователь прервал её на полуслове - GPT-Live тут же перестраивает ответ.
OpenAI обещает, что случайная пауза больше не будет восприниматься как конец фразы: система стала точнее отличать раздумье от завершённой реплики и лучше выделяет голос на фоне посторонних звуков. Для запуска переозвучили все девять голосов ChatGPT.
Кто думает, пока модель говорит
Для сложных задач - поиска в интернете, многошагового рассуждения, работы с инструментами - GPT-Live передаёт запрос фронтир-модели (на старте это GPT-5.5) и продолжает разговор, пока та считает в фоне. Когда результат готов, GPT-Live возвращает его в беседу, не прерывая её паузой на обработку. Разговорная часть и «тяжёлое мышление» разделены - это позволяет OpenAI обновлять модель для сложных задач независимо от голосового слоя.
Отдельно система умеет работать синхронным переводчиком: собеседники говорят каждый на своём языке, и GPT-Live переводит с минимальной задержкой. Во время разговора ChatGPT также может показывать визуальные карточки - прогноз погоды, курсы акций, спортивные результаты, карты - прямо поверх голосового интерфейса.
Кому доступно и чего пока нет
GPT-Live выходит в двух версиях. GPT-Live-1 становится голосом по умолчанию для тарифов Go, Plus и Pro, GPT-Live-1 mini - для бесплатного плана. Разработчикам и корпоративным клиентам доступ к API обещают «скоро», пока можно только записаться в лист ожидания.
Есть и ограничения. На старте GPT-Live не работает с видео и демонстрацией экрана - для этих сценариев придётся вернуться к прежним Standard и Advanced Voice Mode, которые никуда не делись. Для части языков модель пока говорит с заметным акцентом или спотыкается на беглости - OpenAI признаёт это прямо и обещает донастройку.
Тесты против старой версии
По данным OpenAI, в парных сравнениях длинных разговоров (5–10 минут) пользователи заметно чаще предпочитали GPT-Live старому Advanced Voice Mode - по естественности, умению держать очередь реплик и реакции на перебивания. На GPQA, тесте экспертных научных рассуждений, GPT-Live обошла предшественника с большим отрывом. На BrowseComp, который проверяет агентный поиск сложно находимой информации, тоже заметный рост. На собственном внутреннем тесте телеком-поддержки τ³-Voice Telecom модель также опередила Advanced Voice Mode. Все цифры - из тестов самой OpenAI, независимого замера пока не было.
Защита для голосовых разговоров
Живой голос - риск другого рода, чем текстовый чат: реакция должна быть безопасной здесь и сейчас, а не после модерации задним числом. OpenAI расширила тесты именно под аудиоформат - с фокусом на самоповреждение, психоз и манию, эмоциональную привязанность к ИИ, насилие и сексуальный контент. Если система замечает потенциально небезопасный ответ прямо во время разговора, она может мягко перенаправить беседу, предложить ресурсы поддержки или в критичных случаях завершить разговор; для тем, связанных с самоповреждением, голосовой режим адаптировали под линии психологической помощи.
Отдельно прописаны ограничения для подростков через родительский контроль, а связанные с аккаунтом родители могут получать уведомления при признаках высокого риска. Голоса в GPT-Live - фиксированный набор, модель специально не умеет имитировать голос конкретного человека.
Google, Sesame и Hume уже рядом
Живой голосовой ИИ - не изобретение OpenAI в одиночку. Gemini Live у Google построен на похожем принципе нативной обработки звука с низкой задержкой и глубоко завязан на Workspace и Android. Стартап Sesame до недавнего времени многие называли самым «живым» голосовым ассистентом на рынке - компания сделала ставку именно на естественность речи. Hume AI пошла в другую сторону: её Empathic Voice Interface распознаёт больше 48 оттенков эмоций по интонации и дыханию, а не старается звучать по-человечески в целом.
GPT-Live выходит на поле, где естественность голоса уже не редкость - редкость связка живого разговора с полноценным фронтир-интеллектом в фоне. Насколько разница ощущается в реальном использовании, а не в демо на 5–10 минут, покажут ближайшие недели: OpenAI сама признаёт, что часть языков и сценариев ещё не дотянута.