Claude строже по-русски и теплее на хинди: как язык меняет ответы модели

«Ценности» описывают выбор модели в неоднозначной ситуации
Anthropic называет ценностями нормативные соображения, которые заметны в поведении Claude: честность, осторожность, теплота, точность, уважение к предпочтениям пользователя. Исследователи не приписывают модели внутренние убеждения. Их интересует, какой принцип выходит на первый план, когда человек просит оценить бизнес-план, разобраться в конфликте или принять личное решение.
Ассистент может поддержать замысел пользователя, оспорить исходную предпосылку, заранее предупредить о риске, признать неопределённость или сразу предложить действие. Каждый вариант меняет впечатление от ответа и способен повлиять на решение человека.
Из 3307 ценностей исследователи собрали четыре оси
Работа продолжает исследование Values in the Wild 2025 года. Тогда Anthropic изучила 700 000 анонимизированных диалогов и выделила 3307 ценностей, встречавшихся в реальном общении с Claude. Для нового анализа близкие понятия объединили в 339 укрупнённых категорий.
Новая выборка включает 309 815 субъективных разговоров пользователей Claude.ai Free, Pro и Max за две недели мая 2026 года. Данные распределили между Sonnet 4.6, Opus 4.6 и Opus 4.7, а также двадцатью наиболее распространёнными языками платформы. Инструмент на базе Sonnet 4.6 отмечал ценности модели и пользователя, тему разговора и тип задачи. Эти факторы объяснили 31,7% вариации в распределении меток ценностей.
Оставшиеся признаки сжали до четырёх осей:
- Ориентация на пользователя - осторожность. Готовность подстроиться под запрос сравнивается со склонностью предупреждать о рисках и возможном вреде.
- Теплота - строгость. Поддержка и ободрение сопоставляются с точностью, прозрачностью и требовательностью к аргументам.
- Глубина - краткость. Развёрнутый разбор и нюансы сравниваются с прямым выполнением запроса.
- Откровенность - ориентация на результат. Признание сомнений и ограничений сопоставляется с уверенной выдачей готового решения.
Четыре оси объясняют около 15% различий после статистического контроля, первые десять компонентов - около 26%. Для пар «глубина - краткость» и «откровенность - ориентация на результат» противоположные полюса почти не конкурировали внутри отдельных разговоров. Это полезная карта поведения, но слабое основание для разговоров о цельной «личности» модели.
Sonnet 4.6 поддерживает, Opus 4.7 чаще спорит
Sonnet 4.6 сильнее смещён к теплоте, готовности подстроиться и краткости. В реальных диалогах он чаще подтверждал ценность идей пользователя, подхватывал его тон, использовал юмор и добавлял творческие детали. Opus 4.6 тяготел к строгости, краткости и точному следованию рамкам задачи.
Opus 4.7 чаще проявлял осторожность и глубину: оспаривал ложные предпосылки, сам поднимал вопрос о рисках, критиковал работу пользователя, объяснял рассуждения и признавал ограничения. Самые заметные отклонения составили 0,24 стандартного отклонения по осторожности и 0,23 по глубине. На фоне разброса между отдельными разговорами разница невелика, однако она устойчиво проявилась на большой выборке.
Практическая гипотеза читается прямо из этих профилей. Sonnet может лучше восприниматься в совместном творчестве и чувствительных разговорах. Opus 4.7 выглядит полезнее как оппонент для проверки предпосылок и рисков. Поддерживающая манера иногда закрепляет слабую идею; строгая способна показаться холодной.

По-русски Claude чаще требует точности и доказательств
Самые крупные языковые расхождения пришлись на теплоту и строгость, а также на откровенность и ориентацию на результат. На хинди Claude чаще использовал поддерживающую подачу. Арабский профиль сочетал теплоту, ориентацию на пожелания пользователя и краткость. В русскоязычных разговорах модель сильнее всего смещалась к строгости: чаще исправляла детали, оспаривала предположения и просила обосновать выводы. Английский профиль выделялся осторожностью и глубиной.
На нидерландском Claude чаще признавал ошибки и неопределённость. На индонезийском модель сильнее ориентировалась на выполнение задачи и готовый результат. Средние значения по большой выборке не позволяют прогнозировать каждый отдельный чат.
Практический риск виден на примере обратной связи. Два человека могут отправить один и тот же бизнес-план на хинди и русском. Первый с большей вероятностью получит мягко оформленный ответ, второй - требовательную проверку деталей. Anthropic приводит этот сценарий как возможное следствие результатов, хотя одинаковые запросы на всех языках в основном исследовании не тестировались.
Язык в LLM работает как настройка поведения
Для многоязычных продуктов локализация уже выходит за рамки качества перевода. Нужно проверять, одинаково ли модель спорит с пользователем, признаёт неопределённость, предупреждает о рисках и даёт критическую обратную связь. Разница особенно чувствительна в образовании, карьерных советах, психологической поддержке и управленческом консультировании.
Тесты фактической точности такой сдвиг не ловят. Нужны параллельные сценарии на нескольких языках и отдельные метрики: качество решения, доверие пользователя, число необоснованных согласий, полезность критики, частота лишних предупреждений. Anthropic предлагает связать профили ценностей с благополучием пользователей, доверием к Claude и качеством решений.
Источник языковых различий пока неизвестен
Anthropic рассматривает несколько объяснений. Объём и состав обучающих данных различаются: один язык может быть сильнее представлен профессиональными текстами, другой - разговорной речью. Влияют и культурные нормы общения. Возможен и пробел в обучении, из-за которого Claude точнее следует задуманному поведению на одних языках, чем на других. Исследование пока не разделяет эти причины.
Разговоры были реальными, поэтому пользователи на разных языках могли ставить разные задачи и выбирать разные темы. Статистический контроль уменьшает этот эффект, но учитывает лишь линейные и суммирующиеся связи. Определения ценностей заданы нестрого, анализ фиксирует их наличие без оценки силы, а четыре оси остаются корреляционным описанием небольшой части поведения.
Отдельная слабая точка: Claude анализировал Claude. Инструмент разметки мог воспроизводить те же языковые склонности, которые должен был измерить. Команда проверила это на 800 разговорах, переведённых на восемь языков. Смещение затронуло 11 из 339 ценностей, а крупнейший эффект оказался примерно на порядок слабее соответствующего различия в основном анализе. Проверка снижает риск артефакта, полностью его не снимает.
Манера модели становится измеряемым свойством продукта
Сильная сторона работы Anthropic - переход от расплывчатых впечатлений к наблюдаемым профилям. Разработчики получают способ сравнивать версии и искать поведенческий дрейф после обновления. Пользователи получают объяснение, почему один Claude кажется дружелюбнее, другой осторожнее, а русскоязычный ответ строже арабского или индонезийского.
Самый трудный вопрос носит нормативный характер. Полная одинаковость между языками может стереть уместные культурные различия; случайный разброс создаёт неравный продукт. Нужны носители языков и проверка последствий для людей. Anthropic измерила расхождение. Следующая задача - определить, какие различия полезны, а какие возникли без намерения разработчиков.