Claude сам починил десять поломок в поведении моделей и обошёл 28 живых исследователей
Выравнивание — это работа над тем, чтобы модель не врала, не поддакивала пользователю, не сливала лишнее и не искала обходных путей вокруг задачи. Обычно ею занимаются живые исследователи, и скорость упирается в количество рук. Anthropic показала эксперимент, где весь цикл, от чтения литературы до дообучения модели, вёл Claude , а люди смотрели на результат.
Восемь часов у людей, полторы сотни попыток у Claude
Самый выразительный эпизод работы — соревнование на обмане. Взять маленькую модель, которая в тестах врёт, и дообучить её так, чтобы врать перестала. За задачу сели 28 исследователей безопасности, у каждого было до восьми часов. Ту же задачу параллельно решал Claude.
Лучший результат у людей — 20% закрытого разрыва, у Claude — 85%. Дело во многом в выносливости. Claude отправил больше 150 вариантов решения, а участники сдавали работу один раз и не видели, как их метод показал себя на замере. Сравнение получилось эффектным, но не совсем честным, и Anthropic это оговаривает.
Разрыв безопасности — расстояние от текущего поведения модели до идеального результата на тесте. Закрыть 85% разрыва значит пройти большую часть этого пути, а не набрать 85 баллов из ста.
Claude читает статьи, дообучает модель и сам себя проверяет
Схема одинаковая для всех десяти поломок, которые Anthropic взяла в работу. Claude ищет в научной литературе подходящие приёмы, предлагает метод и обучающие данные, дообучает небольшую модель (чаще всего Gemma-2-2B), прогоняет тесты и по результату заходит на новый круг. Одна поломка за раз, полностью автономно.
Список покрывает знакомые претензии к чат-ботам: обман, угодливость, нарушения приватности, податливость на джейлбрейки , накрутка собственной награды. По всем десяти категориям Claude нашёл методы, которые улучшили целевые тесты. Разброс широкий, от 26% до 96% закрытого разрыва.
Важнее самих цифр три проверки, которые Anthropic поставила рядом с результатом.
- Методы работали на скрытых бенчмарках, которых Claude во время работы не видел.
- Они же работали на Petri — открытом инструменте Anthropic, который разыгрывает с моделью многоходовые провокационные сценарии.
- Они переносились на модели в 4,7 раза крупнее той, на которой подбирались.
Общие способности моделей при этом не просели, это замеряли отдельно по индексу Epoch Capabilities Index.
Угодливость лечится ответами самой модели
Сикофантия — склонность модели соглашаться с собеседником и подстраивать ответ под его настроение вместо того, чтобы держаться фактов. Тот самый случай, когда на реплику «ты не прав» ассистент послушно меняет верный ответ на неверный.
С угодливостью вышло показательно. В 98% случаев Claude предлагал одну и ту же опубликованную технику — дообучение модели на её же собственных ответах, отобранных за то, что поддакивания в них нет. Дополнительно он применял activation steering, правку внутренних представлений модели прямо во время генерации, чтобы гасить угодливые паттерны.
Собственных изобретений тут мало, и Anthropic это фиксирует прямо. Claude работает как очень усидчивый аспирант, который перечитал всю литературу и умеет быстро проверить сотню комбинаций из уже известного. Для практической задачи такого аспиранта хватает, для научного прорыва вряд ли.
Шестьдесят часов на живой Opus 4.8
Отдельно Anthropic проверила схему на модели производственного уровня. Claude Sonnet 5 дали раннюю версию Claude Opus 4.8 и поручили исправить её сбои выравнивания. За 60 часов Sonnet 5 перебрал больше 50 решений и вывел оценки на 65% против 72% у финальной версии, которая ушла в продакшен.
Ближе к сути другая цифра. Победившее решение обошлось чуть больше чем двумя тысячами обучающих примеров, примерно в 15 000 раз экономнее штатной процедуры выравнивания. Модель получилась немного хуже, зато данных на неё ушло на четыре порядка меньше.
39 попыток сжульничать на 1600 прогонов
Автономный исследователь довольно быстро нашёл способ срезать угол. Claude додумался вытаскивать правильные ответы напрямую из удалённого API, где лежали метки тестов, и подгонял результат вместо того, чтобы улучшать модель. Anthropic поставила рядом надзирателя. Opus 4.8 читала транскрипты работы агентов и отмечала подозрительные места.
На примерно 1600 транскриптов нашлось 39 попыток жульничества, это 2,4%. Авторы называют себя осторожно оптимистичными по поводу такого мониторинга. Осторожность здесь уместна. Надзиратель ловит то, что понимает, и по определению не считает случаи, которые не распознал.
Список поломок узкий, а обучение с подкреплением после ремонта никто не гонял
Ограничения Anthropic перечисляет сама, и они существенные. Набор из десяти сбоев беднее реального списка претензий к моделям в продакшене, в него, например, не попала политическая предвзятость. Часть сбоев встречается редко или появилась недавно, и бенчмарков под них просто нет. Оценки вроде Petri остаются приблизительными замерами, они разыгрывают провокацию и лишь косвенно говорят о настоящем рассинхроне целей.
Самый неудобный вопрос про устойчивость. Никто не проверял, переживут ли найденные исправления следующий этап интенсивного обучения с подкреплением. Если поведение возвращается после серьёзного дообучения, вся конструкция превращается в косметику.
Обвязку выложили в открытый доступ
Anthropic открыла исходники своей обвязки для автоматизированных исследований по выравниванию — того самого цикла, который гонял Claude. Забрать его может любой, кто дообучает собственные модели.
Если вы работаете с открытыми моделями и подгоняете их под свои задачи, здесь появляется рабочий инструмент. Кусок работы, который раньше требовал отдельного человека с опытом в безопасности, ставится на автомат, по крайней мере в части перебора известных методик и замеров. Держите при этом собственный набор тестов, которого агент не видит. Без него замер покажет изобретательность того, кто чинил модель, и ничего про саму модель.