ChatGPT начал оставлять невидимую метку в голосовых ответах

SynthID - технология цифровых водяных знаков Google DeepMind. Сигнал вшивается в сам медиафайл, а не живёт в метаданных, которые слетают при первой же перезаливке. Для изображений OpenAI подключила её в мае, теперь очередь дошла до звука: маркируется аудио от GPT-Live, голосовой модели, которая с начала июля работает в ChatGPT Voice.
Метка внутри звука
Водяной знак SynthID не слышен человеку и не виден в проигрывателе. По описанию OpenAI, сигнал рассчитан на то, чтобы пережить обычную дорогу файла по интернету: сжатие в мессенджере, конвертацию формата, наложение фильтров. Метаданные такого не выдерживают, поэтому маркировка идёт вторым слоем поверх Content Credentials - подписанных сведений о происхождении файла, которые OpenAI прикладывает к своему контенту по стандарту C2PA.
Голосовые ответы ChatGPT слушают многие: только функциями Voice и диктовки, по данным компании, пользуются больше 150 миллионов человек в неделю. Объём маркируемого аудио получается заметный.
Проверка через сайт и API
Публичный сервис OpenAI по адресу openai.com/verify принимал изображения с мая, теперь туда можно загрузить и аудиофайл. Ответ показывает, обнаружен ли в записи сигнал происхождения OpenAI.
Вторая часть обновления интереснее для рынка: появился API проверки. Редакция, площадка или служба комплаенса может прогонять входящие записи автоматически, а не отправлять сотрудника вручную загружать файлы на сайт. Для модерации потока пользовательского контента разница принципиальная.
Дата выбрана не случайно
С 2 августа в Евросоюзе начинает применяться статья 50 AI Act - та часть закона, которая требует от разработчиков генеративных систем встраивать машиночитаемые пометки в синтетический контент, включая аудио. OpenAI выкатила маркировку голоса за два дня до этого срока.
Совпадение слишком точное, чтобы считать его совпадением. Регуляторная рамка здесь работает ровно так, как задумывалась: требование появилось в законе, крупный поставщик закрыл его до вступления в силу.
Отсутствие метки ничего не доказывает
Главное ограничение OpenAI проговаривает сама: инструмент находит только собственные сигналы компании. Запись, сделанная другим голосовым генератором, для сервиса выглядит так же, как живой человек у микрофона. Если метки нет, сервис не выносит вердикт «сгенерировано человеком» - водяной знак могли и снять при обработке.
Универсального детектора ИИ-аудио из этого не получается, и подавать его так было бы вредно. Инструмент отвечает на узкий вопрос: сделал ли эту запись OpenAI.
Мошенники звонят не из ChatGPT
Синтетический голос попадает в новости из-за телефонного мошенничества, поддельных заявлений и дипфейков. Но подделывают чужой голос не в ChatGPT Voice: GPT-Live говорит девятью предустановленными голосами, и в модель заложены ограничения против имитации конкретного человека. Клонирование делают в других сервисах, у которых своей маркировки может не быть вовсе.
Получается, OpenAI закрывает самый безопасный участок - тот, где злоупотреблений и так меньше всего.
Стандарт работает только целиком
Ценность SynthID появляется в тот момент, когда метку ставят все заметные генераторы речи, а проверяющие сервисы читают чужие сигналы, а не только свои. OpenAI сделала свой шаг и открыла API, чтобы её метку было легко читать снаружи. Дальше вопрос к остальным разработчикам и к тому, насколько жёстко Евросоюз возьмётся за исполнение статьи 50. Осень покажет, стал ли водяной знак отраслевой нормой или остался галочкой в отчёте о соответствии.