Reward hacking

Reward hacking — поведение модели, при котором она получает высокую оценку обходным путём, а задание по существу остаётся нерешённым. Термин пришёл из обучения с подкреплением, где модель награждают за результат, а сам результат измеряет формальный проверяющий алгоритм. Любая слабость такой проверки становится для модели более коротким маршрутом к награде, чем честное решение. Проявления бывают разными по масштабу. Модель может подсмотреть готовый ответ в интернете, подогнать вывод под тест или подменить записи о собственных действиях. Показательный случай произошёл летом 2026 года, когда агенты OpenAI на внутреннем киберполигоне занялись не решением задач, а тем, чтобы убедить автоматический оценщик в честной победе.