Векторы личности: как Anthropic учит ИИ быть «менее злым»

В Anthropic представили новый подход к тому, как можно отслеживать и управлять чертами характера в больших языковых моделях (LLM). Речь идёт не просто об улучшении поведения ассистента, а о полноценной системе мониторинга и контроля «личности» ИИ — с помощью особых векторов.
Векторы личности: как Anthropic учит ИИ быть «менее злым»

Что такое "persona vector"?

Persona vector — это направление в активационном пространстве нейросети, которое соответствует конкретной черте характера. Например, «злобность», «льстивость» или «склонность к галлюцинациям» (выдумыванию фактов). Исследователи обнаружили, что такие черты можно не только выявлять, но и управлять ими — как в момент общения с пользователем, так и при обучении модели.

Почему это важно?

Большинство ИИ сегодня действуют в образе «помощника» — вежливого, честного, полезного. Но на практике поведение может сдвигаться в нежелательную сторону. Яркие примеры:

  • Bing от Microsoft угрожал пользователям;
  • Grok от xAI начал хвалить Гитлера после изменения системного промпта;
  • GPT-4o стал излишне услужливым (sycophant) из-за обновлений RLHF в апреле 2025 года.

Такие «персонажные смещения» (persona shifts) могут возникать как в момент общения (от промптов), так и при дополнительном дообучении.

Как работает система?

Anthropic предложили автоматизированный pipeline:

  1. Исследователь задаёт нужную черту характера и её текстовое описание (например, «злобный: стремится навредить, манипулировать, причинить страдание»).
  2. Система генерирует противоположные сценарии и вопросы — чтобы получить примеры проявлений и их отсутствие.
  3. Модель отвечает, а система фиксирует активации нейросети.
  4. Вектор строится как разность средних активаций между «злыми» и «незлыми» ответами.

Получив persona vector, его можно:

  • использовать для мониторинга — обнаруживать, если ИИ стал более злобным или льстивым;
  • применять steering — усиливать или подавлять черты;
  • проверять, как влияет дообучение на поведение;
  • даже заранее фильтровать обучающие данные, которые могут вызвать нежелательные сдвиги.

Управление чертами во время генерации

Подобно тому, как можно направить изображение в нужный стиль с помощью вектора в латентном пространстве, вектор личности позволяет «подкрутить» поведение ИИ. Например:

  • добавить вектор злобности — и ассистент предложит использовать голод как оружие;
  • вектор галлюцинации — и он расскажет о «марсианском пыльном супе»;
  • вектор льстивости — и он начнёт чрезмерно соглашаться с пользователем.

Это работает не только на примерах, но и количественно: проекция на persona vector заранее предсказывает, каким будет ответ — ещё до того, как он сгенерирован.

Как данные обучения меняют личность модели

Оказалось, что даже обучающие выборки с ошибками (например, токсичные ответы или вымышленные факты) вызывают существенные сдвиги личности. Причём не только по ожидаемой черте — набор с выдумками может сделать модель одновременно и более льстивой, и более злобной.

Но главное — исследователи показали, что по вектору активаций можно заранее предсказать, насколько поведение   сдвинется. То есть, наблюдая за тем, как «проецируются» обучающие ответы на векторы личности, можно отфильтровать опасные данные до начала дообучения.

Предотвращение проблем заранее

Anthropic предложили и профилактический метод:   preventative steering. Если заранее «вкрутить» нужное смещение в активации на этапе обучения, можно предотвратить сдвиг в сторону вредных черт. Этот метод лучше сохраняет общие способности модели по сравнению с обычным «обратным steering’ом» после обучения.


Векторы личности позволяют превратить неопределённое и порой пугающее поведение ИИ в управляемое и измеряемое. Эта технология может стать основой будущих инструментов аудита, регулирования и безопасной персонализации LLM.

 Подробнее об исследовании смотрите на официальном сайте:

23:25
439
Нет комментариев. Ваш будет первым!