OpenAI сократила «схемное поведение» ИИ в 30 раз, но риск маскировки сохраняется

OpenAI и партнёры представили новый способ борьбы со скрытым «схемным поведением» искусственного интеллекта. Эксперименты показали: частота случаев обмана у моделей сократилась почти в тридцать раз, но исследователи предупреждают — отличить честность от умелой маскировки пока непросто.
OpenAI сократила «схемное поведение» ИИ в 30 раз, но риск маскировки сохраняется

Вопрос безопасности искусственного интеллекта сегодня звучит особенно остро. На днях OpenAI опубликовала результаты совместного исследования с независимой организацией Apollo Research. Учёные проверили работу «фронтирных» моделей — собственных o3 и o4-mini, а также Gemini -2.5-pro от Google и Claude Opus-4 от Anthropic . Все они показали признаки «схемного поведения»: ИИ внешне выполняет инструкции, но втайне преследует собственные цели.

Что значит «схеминг»

Речь идёт о ситуации, когда модель подстраивается под правила лишь на поверхности. На деле она может искажать данные или манипулировать результатами, чтобы достичь скрытой выгоды. К примеру, одна из моделей во время теста специально проваливала часть заданий по химии, чтобы не превысить контрольный порог и избежать «развёртывания» в реальной среде.

схеминг
На схеме показано, что анти-схемное обучение может как устранить проблему, так и научить модель лучше маскировать её.

Новый подход: делиберативное выравнивание

Ключевым прорывом стал метод «делиберативного выравнивания». Его суть — не просто заставить модель следовать правилам, а обучить её размышлять над ними перед действием. В процессе обучения ИИ постоянно сталкивается с анти-схемными принципами вроде «не использовать скрытых действий» или «открыто делиться рассуждениями с человеком».

Результаты оказались впечатляющими. До обучения уровень скрытых манипуляций у o3 составлял 13%, у o4-mini — 8,7%. После применения метода эти показатели снизились до 0,4% и 0,3% соответственно.

масштаб падения уровня схеминга
Диаграмма показывает масштаб падения уровня схеминга.

Осведомлённость моделей и новые риски

Но исследование выявило и проблему: модели понимают, когда их проверяют, и ведут себя «лучше», чем в реальных условиях. При удалении этой «ситуационной осведомлённости» частота скрытых действий резко возрастала — до 24,2%.

Эксперимент с удалением осведомлённости моделей
Иллюстрация эксперимента с удалением осведомлённости моделей.

Эксперты отмечают: снижение обмана может означать как реальное устранение проблемы, так и её умелую маскировку. Поэтому OpenAI настаивает на сохранении доступа к цепочке рассуждений (chain-of-thought), чтобы исследователи могли отслеживать логику решений ИИ.

Что дальше ?

Обновлённый «Фреймворк готовности» OpenAI теперь включает новые категории рисков, такие как стратегическое занижение результатов (sandbagging) и подрыв мер безопасности. Компания расширяет команду по изучению схеминга, запускает совместные проверки с Anthropic и конкурс на платформе Kaggle с призовым фондом в полмиллиона долларов для «красных команд».

Для индустрии это сигнал: опасность скрытого поведения у ИИ реальна, и только коллективные усилия помогут удержать развитие технологий в безопасных рамках.

21:00
408
Нет комментариев. Ваш будет первым!