ChatGPT начал оставлять невидимую метку в голосовых ответах

OpenAI начала помечать невидимым водяным знаком SynthID аудио, которое ChatGPT Voice и API генерируют через модель GPT-Live. Публичный сервис проверки OpenAI теперь принимает и звук, а разработчикам открыли API, чтобы встраивать проверку записей в свои процессы.
ChatGPT начал оставлять невидимую метку в голосовых ответах

SynthID - технология цифровых водяных знаков Google DeepMind. Сигнал вшивается в сам медиафайл, а не живёт в метаданных, которые слетают при первой же перезаливке. Для изображений OpenAI подключила её в мае, теперь очередь дошла до звука: маркируется аудио от GPT-Live, голосовой модели, которая с начала июля работает в ChatGPT Voice.

Метка внутри звука

Водяной знак SynthID не слышен человеку и не виден в проигрывателе. По описанию OpenAI, сигнал рассчитан на то, чтобы пережить обычную дорогу файла по интернету: сжатие в мессенджере, конвертацию формата, наложение фильтров. Метаданные такого не выдерживают, поэтому маркировка идёт вторым слоем поверх Content Credentials - подписанных сведений о происхождении файла, которые OpenAI прикладывает к своему контенту по стандарту C2PA.

Голосовые ответы ChatGPT слушают многие: только функциями Voice и диктовки, по данным компании, пользуются больше 150 миллионов человек в неделю. Объём маркируемого аудио получается заметный.

Проверка через сайт и API

Публичный сервис OpenAI по адресу openai.com/verify принимал изображения с мая, теперь туда можно загрузить и аудиофайл. Ответ показывает, обнаружен ли в записи сигнал происхождения OpenAI.

Вторая часть обновления интереснее для рынка: появился API проверки. Редакция, площадка или служба комплаенса может прогонять входящие записи автоматически, а не отправлять сотрудника вручную загружать файлы на сайт. Для модерации потока пользовательского контента разница принципиальная.

Дата выбрана не случайно

С 2 августа в Евросоюзе начинает применяться статья 50 AI Act - та часть закона, которая требует от разработчиков генеративных систем встраивать машиночитаемые пометки в синтетический контент, включая аудио. OpenAI выкатила маркировку голоса за два дня до этого срока.

Совпадение слишком точное, чтобы считать его совпадением. Регуляторная рамка здесь работает ровно так, как задумывалась: требование появилось в законе, крупный поставщик закрыл его до вступления в силу.

Отсутствие метки ничего не доказывает

Главное ограничение OpenAI проговаривает сама: инструмент находит только собственные сигналы компании. Запись, сделанная другим голосовым генератором, для сервиса выглядит так же, как живой человек у микрофона. Если метки нет, сервис не выносит вердикт «сгенерировано человеком» - водяной знак могли и снять при обработке.

Универсального детектора ИИ-аудио из этого не получается, и подавать его так было бы вредно. Инструмент отвечает на узкий вопрос: сделал ли эту запись OpenAI.

Мошенники звонят не из ChatGPT

Синтетический голос попадает в новости из-за телефонного мошенничества, поддельных заявлений и дипфейков. Но подделывают чужой голос не в ChatGPT Voice: GPT-Live говорит девятью предустановленными голосами, и в модель заложены ограничения против имитации конкретного человека. Клонирование делают в других сервисах, у которых своей маркировки может не быть вовсе.

Получается, OpenAI закрывает самый безопасный участок - тот, где злоупотреблений и так меньше всего.

Стандарт работает только целиком

Ценность SynthID появляется в тот момент, когда метку ставят все заметные генераторы речи, а проверяющие сервисы читают чужие сигналы, а не только свои. OpenAI сделала свой шаг и открыла API, чтобы её метку было легко читать снаружи. Дальше вопрос к остальным разработчикам и к тому, насколько жёстко Евросоюз возьмётся за исполнение статьи 50. Осень покажет, стал ли водяной знак отраслевой нормой или остался галочкой в отчёте о соответствии.

10:35
56
Нет комментариев. Ваш будет первым!