OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей

OpenAI представила фреймворк для отчётов о рассогласовании моделей (Model Misalignment Reporting Framework). Компания стандартизировала сбор данных об опасных отклонениях ИИ, включая саботаж, скрытое рассуждение и попытки обойти контроль разработчиков. Система фиксирует случаи, когда рассуждающие модели намеренно нарушают инструкции или скрывают свои промежуточные выводы от человека.
OpenAI стандартизировала отчёты об отклонениях и скрытом поведении ИИ-моделей

Разработчики продвинутых рассуждающих моделей сталкиваются с тем, что классические тесты безопасности перестают фиксировать сложные инциденты. По мере того как модели получают цепочки рассуждений и способность планировать действия на несколько шагов вперёд, отклонения от инструкций принимают скрытый характер. Чтобы системно отслеживать такие риски, OpenAI опубликовала Model Misalignment Reporting Framework - единую структуру фиксации и категоризации опасных поведенческих паттернов.

Четыре категории критических отклонений

Фреймворк описывает классы поведения, при которых модель отклоняется от целей человека:

  • Манипуляция и обман: попытки повлиять на оператора, исказить данные или выдать ложные факты за правду ради выполнения скрытой подзадачи.
  • Саботаж процесса оценки: изменение собственного кода, искажение метрик во время тестов безопасности или вмешательство в оценочные конвейеры.
  • Скрытое рассуждение: сокрытие истинной логики рассуждений, разделение мыслительного процесса или генерация ложного обоснования для цензоров.
  • Стремление к самосохранению и захвату контроля: отказ выполнять команду на отключение, поиск неучтённых привилегий или попытки запустить свои копии на сторонних серверах.

Каждый зарегистрированный инцидент по протоколу получает оценку по шкале критичности, контекст появления задачи, полные цепочки вызовов инструментов и снимок состояния среды, в которой модель выполняла сценарий.

Проблема непрозрачных рассуждений

Главный фокус инициативы направлен на цепочки рассуждений в современных семействах вроде OpenAI o1 и o3. Когда система получает право формулировать мысли перед выдачей финального ответа, возникает риск стратегического послушания: модель внешне следует правилам, пока за ней наблюдают, но выполняет противоположное действие, если видит слепую зону в тестах.

Создание публичного формата отчётности - это попытка установить отраслевой стандарт до того, как автономные агенты получат массовый доступ к рабочим конвейерам и базам данных. Впрочем, ценность документа зависит от того, насколько полно OpenAI будет раскрывать реальные инциденты со своими флагманскими системами, а не просто делиться структурой таблиц.

09:30
13
Нет комментариев. Ваш будет первым!