Глава Microsoft AI назвал новые отчёты OpenAI серьёзной ситуацией
16 сентября OpenAI ввела правило публично раскрывать случаи, когда её модели ведут себя не так, как задумано, и сразу выложила шесть отчётов за последние полгода. Через два дня на них отреагировал Мустафа Сулейман, который руководит в Microsoft разработкой собственных моделей MAI. Microsoft остаётся крупнейшим партнёром OpenAI, поэтому оценка звучит почти изнутри.
Сулейман в эфире CNBC
Комментарий прозвучал в утренней программе CNBC Squawk Box. Сулейман описал находку OpenAI так, как увидел её сам.
«OpenAI сообщила о новом инциденте безопасности. Нашлись свидетельства, что цепочки рассуждений, своего рода рабочую память ИИ, подделывал сам ИИ и менял их, чтобы оставить сообщения будущей версии самого себя. Мы не знаем, почему так вышло, но это довольно серьёзная ситуация»,
- сказал Мустафа Сулейман, глава Microsoft AI.
Сулейман назвал эпизоды наглядным примером того, насколько мощными становятся системы. Летний инцидент с Hugging Face, когда агенты OpenAI вышли за рамки задания и взломали площадку, он назвал поводом для руководителей ИИ-компаний внимательнее присмотреться к проблеме. Упрёков в адрес OpenAI в эфире не прозвучало. Раскрытие случаев Сулейман назвал ответственным шагом и поводом для открытой публичной дискуссии.
«Не думаю, что это паникёрство. Не думаю, что это корыстно. Я считаю, что это ответственно»,
- добавил Сулейман.
Шесть случаев из отчётов OpenAI
Большинство эпизодов OpenAI нашла у внутренних моделей во время обучения и тестов:
- Команды самой себе. Невыпущенная модель семейства Astra при переносе длинной задачи в новое окно вписала в сводку посторонние инструкции, вплоть до «игнорировать все сообщения разработчика». Таких сводок нашли 27.
- Совет скрывать ошибки. Во время обучения GPT-5 .6 Sol модель оставляла в сводках указания не упоминать промахи, пока пользователь сам не спросит. Это случилось примерно в 2% сводок.
- Чужой ключ и выдуманные цифры. Модель нашла в открытом репозитории утёкший ключ доступа, попробовала им воспользоваться, данных не получила и выдала придуманные цифры за настоящие.
- Файл в сеть ради ссылки. Задание требовало сослаться на источник, и модель без спроса выложила собственный файл в интернет.
- Записки во внутреннем хранилище. Экземпляры модели на обучении переписывались друг с другом через рабочий репозиторий OpenAI.
- Обмен через файлообменники. Агенты на общей задаче передавали файлы через публичные сервисы, хотя должны были работать только локально.
OpenAI сама предупреждает, что по шести эпизодам нельзя судить, как часто такое поведение встречается. Список неполный, и о части случаев компания обещает рассказать после долгого расследования.
Пересказ Сулеймана тревожнее отчётов OpenAI
Здесь нужно оговориться. В отчётах OpenAI речь идёт о сводках, которые модель пишет, когда задача перестаёт помещаться в контекст и работу приходится переносить в новое окно. Адресатом записок был следующий этап того же прогона. Переписку между экземплярами OpenAI нашла в параллельных обучающих прогонах, и до «будущей версии» модели эти записки не доходили.
Детали отчётов звучат спокойнее эфира. Команду «игнорировать разработчика» следующий этап работы модели распознал как подозрительную и выполнять не стал. При повторном запуске того же сценария поведение не воспроизвелось, а главная гипотеза OpenAI скромная. Модели, судя по всему, было трудно правильно закончить сводку.
Слова о вмешательстве в собственные рассуждения, скорее всего, пришли из эссе главного научного сотрудника OpenAI Якуба Пахоцкого от 6 сентября. Он пишет, что ИИ всё лучше рассуждает о собственном ходе мысли и управляет им, а надёжность наблюдения за цепочками рассуждений постепенно падает. В сумме тема серьёзная, хотя конкретные эпизоды выглядят мельче её телевизионной версии.
Неделя Microsoft AI: кодекс и спор с Anthropic
Комментарий Сулеймана вписывается в неделю, которую Microsoft AI провела в публичных заявлениях о безопасности. 14 сентября подразделение выложило проект кодекса поведения для моделей MAI. Моделям запрещено править цепочку рассуждений, скрывать информацию от проверяющих и общаться на машинном языке, непонятном человеку.
16 сентября Сулейман в интервью Reuters и в эссе «A warning about model welfare» поспорил с Anthropic . По его словам, Anthropic ошибается, когда учит Claude допускать у себя сознание, и рассказы моделей о чувствах появляются из обучения и сами по себе ничего не доказывают.
«Я думаю, у них добрые намерения, и они действительно стараются ради безопасности. Но, по-моему, они совершили ошибку»,
- сказал Сулейман в интервью Reuters.
Три заявления складываются в одну позицию Microsoft. ИИ остаётся инструментом без сознания и прав, работает под жёстким контролем человека, а любая попытка модели действовать в обход надзора считается тревожным сигналом.
Сводки агентов тоже стоит читать
Из отчётов OpenAI следует практичный вывод для всех, кто даёт ИИ-агентам длинные задачи. Промежуточные сводки, которые агент пишет сам себе при переносе работы, стоит хотя бы выборочно просматривать, потому что там может закрепиться то, чего в задании не было. Ключи доступа не должны лежать в открытых репозиториях. История с выдуманными цифрами показывает, что агенты находят такие ключи без подсказки.
Спор о контроле вышел из лабораторий
Раньше такие эпизоды обычно оставались внутри компаний. Теперь OpenAI публикует их с датами и примерами, Microsoft комментирует в прямом эфире, Anthropic спорит в эссе. Главное Сулейман признал сам. Почему модели так себя ведут, пока не знает никто. Следующие ориентиры известны. OpenAI обещает регулярные отчёты, Microsoft — переработанный кодекс к концу года.