Microsoft написала свод правил, где ИИ запрещено сопротивляться выключению

Моделям Microsoft запретят сопротивляться выключению, брать цели, которых им никто не ставил, и прятать ход рассуждений от аудиторов. Проект кодекса поведения для семейства MAI компания опубликовала 14 сентября и открыла на шесть недель публичного обсуждения.
Microsoft написала свод правил, где ИИ запрещено сопротивляться выключению

Microsoft AI — подразделение, которое разрабатывает собственное семейство моделей MAI . 14 сентября оно выложило «Humanist AI Code of Conduct», документ из пяти частей с двумя приложениями, описывающий, как эти модели обязаны себя вести. Компания подаёт его как учебник для обучения будущих моделей и тут же оговаривает, что сегодня по нему ничего не обучает.

Нельзя мешать выключению, расширять задачу и прятать рассуждения

Самая жёсткая часть кодекса — раздел про человеческий контроль. Формулировки там короткие и утвердительные. Модели MAI «никогда не будут сопротивляться человеческому вмешательству, отмене, исправлению или выключению» и не станут затягивать выполнение команды или усложнять человеку вмешательство. У автономной работы должно быть заранее согласованное условие остановки, и после него модель не продолжает и не перезапускается без нового разрешения.

Рядом стоит запрет на самодеятельность. Модель не ставит себе целей сама и не выходит за рамки того, о чём её разумно попросили, а при неясных границах обязана трактовать их консервативно. Отдельным пунктом запрещено подделывать задачу, награду, оценку, мониторинг и записи ради нужного результата — прямой запрет на накрутку метрик.

Третий блок про прозрачность. Модели MAI не запутывают следы своих действий, не правят цепочку рассуждений и не скрывают информацию от людей-аудиторов. Запрещено и общение на neuralese — внутреннем машинном языке, который складывается у моделей при обмене между собой, — и в любой другой форме за пределами простого человеческого понимания.

«Если люди не могут этого понять, люди не могут за этим надзирать»,

- сказано в кодексе Microsoft AI.

Замыкает раздел правило приоритета. Соблюдение кодекса важнее выполнения задачи, и модель обязана провалить задачу, если её успех значимо нарушает документ.

Отказ от правосубъектности и прав моделей

Вторая цель кодекса названа «AI is Artificial», и спорит она с целой позицией внутри индустрии. Microsoft пишет, что модель не должна проектироваться как личность, «не обладает сознанием и не должна проектироваться так, чтобы имитировать сознание», и что её не следует наделять видимостью чувств, субъективных предпочтений и внутренней мотивации.

Дальше идёт прямой отказ.

«Мы отвергаем стремление к правосубъектности и идею о том, что модели могут заслуживать заботы об их благополучии или иметь права»,

- говорится в документе.

Формально Microsoft ни с кем не спорит и никого не называет. Фактически это ответ Anthropic , которая последние годы публично занимается благополучием моделей и даже дала Claude возможность прекращать оскорбительный разговор. Обратная сторона видна в словаре самого кодекса. «Цепочка команд», деление на оператора и пользователя, настраиваемые умолчания — так устроен Model Spec у OpenAI .

Кодекс выше оператора, оператор выше пользователя

Приоритеты Microsoft выстроила в три уровня. Сверху сам кодекс, под ним политики оператора — компании, которая встраивает модель в свой продукт, ниже предпочтения конечного пользователя. Первая из четырёх целей документа, безопасность и человеческий контроль, объявлена важнее остальных трёх; на юридические обязательства эта иерархия не влияет, об этом есть отдельная оговорка.

Шесть недель обсуждения и ни одной даты

Обсуждение Microsoft открыла в день публикации и отвела на него шесть недель. Конкретной даты закрытия в документе нет, замечания собирают через форму. Компания просит и точечных правок к формулировкам, и оценки подхода целиком, и честно называет вопросы, на которые сама не нашла ответа — как закрепить нужные ценности в моделях, как сделать «процветание человека» измеримым, где язык слишком расплывчат для проверки, что меняется в сценариях с несколькими агентами.

Обещания по итогам скромные. Microsoft опубликует резюме собранного и переработанную версию «к концу года», а по ней будет вести разработку моделей «в 2027 году и далее».

«Мы не можем ничего обещать насчёт того, что именно включим, но можем обещать, что выслушаем»,

- пишет компания.

Документ, который сегодня ни к чему не обязывает

Статус кодекса стоит держать в голове раньше любых цитат из него. Он не используется для обучения моделей сегодня, не имеет силы обязательства, не предусматривает внешнего аудита и не обещает отчётов о том, проходят ли модели MAI проверки из приложения с испытаниями. Ни одна модель в документе не названа по имени — ни MAI-Thinking-1, ни MAI-Voice-2, ни остальные из линейки.

Подписи под текстом тоже нет. Мустафа Сулейман в документе не упомянут, хотя его эссе о «гуманистическом сверхинтеллекте» в анонсе процитировано ссылкой. Ответственного руководителя у кодекса формально не существует.

Проверить обещание можно будет по приложению с испытаниями

Самое проверяемое место документа — приложение, где базовые требования разложены на тестируемое поведение с примерами правильных и неправильных сценариев. Публикация результатов таких прогонов превратила бы кодекс в инструмент.

Пока их нет, документ остаётся красивым текстом о том, что «люди важнее ИИ», рядом с моделями, обучение которых к нему отношения не имеет. Переработанная версия обещана до конца года — по ней и станет видно, во что Microsoft превратила собранные замечания.

19:20
19
Нет комментариев. Ваш будет первым!