Как Яндекс и Сбер учат нейросети говорить по-русски без акцента
Модель может бегло отвечать по-русски и всё равно оставаться иностранкой. Она дробит русские слова на обломки, путает поговорки и плохо помнит местные реалии.
21 сентября Яндекс открыл веса Alice AI Foundation, базовой модели, которую с нуля учили русскому вместе с английским, и подробно описал на Хабре, как это делалось. Хороший повод разобраться, как нейросеть становится русскоязычной и почему крупные компании идут к этому разными дорогами.
Русский текст обходится нейросети дороже
Токен — кусочек текста, с которым работает языковая модель. Это может быть целое слово, его часть или отдельная буква. Словарь токенов составляют заранее, и частые в обучающих данных слова получают собственный токен.
Если словарь собирали в основном на английских текстах, русские слова в нём редкие гости. Модель режет их на куски, и одна и та же фраза превращается в разное число токенов. Хорошо видно на классической панграмме «Съешь же ещё этих мягких французских булок, да выпей чаю». Токенизатор GPT-3 разбивает её на 74 токена, GPT-4 на 36, GPT-4o на 19. Английская фраза про лису и ленивую собаку во всех трёх занимает 10 токенов. А аббревиатуру «СНИЛС» словарь GPT-4 видит как пять отдельных букв.
Исследователи из Оксфорда в 2023 году измерили этот разрыв на переводах одних и тех же текстов на десятки языков. Если пересчитать их опубликованные данные для русского, картина такая:
- GPT-2 и GPT-3 — в 5,7 раза больше токенов, чем на английском;
- GPT-3.5 и GPT-4 — в 2,5 раза больше;
- Llama первых двух поколений — в 1,6 раза больше.
По числу символов русский перевод длиннее английского всего на 9%, так что разницу почти целиком создаёт словарь. OpenAI в 2024 году переделала токенизатор для GPT-4o и показывала, что русская фраза из её примера сжалась в 1,7 раза. Разрыв никуда не делся и сейчас. Яндекс в своём разборе приводит пример из Claude Opus 5, где тестовая фраза на русском занимает 17 токенов против 13 на английском.
Лишние токены бьют по трём вещам сразу. Ответ генерируется медленнее, потому что модель выдаёт текст токен за токеном. Запрос через API стоит дороже, ведь платят именно за токены. И в контекстное окно помещается меньше переписки, так что модель раньше теряет из виду начало разговора.
Русского в обучении западных моделей - доли процента
Словарь решает только половину проблемы. Вторая половина в том, на чём модель учится. В обучающем корпусе Llama 2 компания Meta насчитала 0,13% русского текста, почти 90% пришлось на английский. У GPT-3 в 2020 году доля русского составляла 0,19% по числу слов. Для сравнения, в сыром интернете русскоязычных страниц около 7%, если судить по свежему срезу Common Crawl, открытого архива веба.
Есть и более тонкий эффект. Исследователи из Лозанны в 2024 году заглянули в промежуточные слои Llama 2 и проследили, как модель отвечает на вопросы на русском, французском, китайском и других языках. В средних слоях правильный ответ уже «созрел», но ближе всего он к английскому слову и переводится на язык вопроса только в последних слоях. Авторы сделали вывод, что пространство понятий у модели сдвинуто к английскому.
Anthropic в 2025 году описала картину мягче. У Claude понятия вроде «маленький» и «противоположность» общие для разных языков, и доля таких общих признаков растёт с размером модели. Язык вопроса в этой версии подключается ближе к концу, на этапе ответа.
Сбер пошёл дорогой собственного словаря
Самый прямой выход — учить модель с нуля на корпусе, где русского много, и собирать под него свой словарь. Сбер начал с ruGPT-3 в 2020 году. Старшая версия на 760 млн параметров училась на 600 ГБ русских текстов на суперкомпьютере «Кристофари» и вышла в открытый доступ. В 2023-м появилась ruGPT-3.5 на 13 млрд параметров, которая легла в основу первого GigaChat .
Эффект собственного словаря Сбер посчитал в научной статье о GigaChat 2025 года. Метрика — сколько символов русского текста приходится на один токен. Чем их больше, тем экономнее модель:
- GigaChat — 4,18;
- Mistral -Nemo — 3,18;
- Llama 3 — 3,02;
- Qwen2 — 2,70;
- GPT-4 — 2,04.
Один и тот же русский текст GigaChat укладывает примерно вдвое меньшим числом токенов, чем GPT-4. В ноябре 2025 года Сбер открыл веса GigaChat 3 Ultra Preview на 702 млрд параметров. Её учили с нуля на 14 трлн токенов, из которых около 5,5 трлн синтетические. В июле линейку продолжила более компактная GigaChat 3.5 Ultra на 432 млрд параметров, тоже с открытыми весами.
Т-Банк и Авито переписывают словарь Qwen
Обучение с нуля стоит дорого, поэтому вторая популярная стратегия — взять сильную открытую модель, чаще всего китайскую Qwen , и доучить её русскому. Слабым местом остаётся тот же словарь, и его приходится расширять или переписывать.
Т-Банк в T-Pro 2.0 заменил 34 тыс. редких некириллических токенов Qwen3 на кириллические, сохранив общий размер словаря. Доля слов русской Википедии, которые укладываются в один-два токена, выросла с 38% до 60%. Авито в модели A-Vibe объединил собственный словарь на 60 тыс. русских токенов с 80 тыс. английских от Qwen3, и на русских задачах модель стала работать на 15–25% быстрее.
Похожий подход ещё раньше отработали в МГУ. Проект Ruadapt Михаила Тихомирова и Даниила Чернышёва меняет токенизатор, дообучает модель на русском корпусе и переносит новые представления слов в готовую чат-версию. По оценке авторов, полная адаптация Qwen3-8B укладывается меньше чем в 2000 часов работы видеокарт, а генерация на русском ускоряется до 80%.
Яндекс перешёл на собственный фундамент
Дорогой адаптации одно время шёл и Яндекс, о чём компания писала открыто. YandexGPT 5 Pro в 2025 году стартовала с весов Qwen-2.5-32B, Alice AI LLM прошлой осенью — с весов Qwen3-235B. Вопрос «суверенности» моделей с тех пор стал публичным. В июле, по данным The Bell, Герман Греф заявил, что полностью российская фундаментальная модель осталась одна, сберовская.
MoE (Mixture of Experts, смесь экспертов) — архитектура, в которой модель состоит из множества узких блоков-«экспертов». На каждый токен включается лишь несколько из них, поэтому модель хранит много знаний, но считает быстро и дёшево.
Alice AI Foundation выглядит ответом в этом споре. Её учили полностью с нуля примерно на 18 трлн токенов, со своим словарём на 129 тыс. токенов, оптимизированным под русский. Модель устроена по схеме MoE: из 80 млрд параметров на каждый токен работают около 3 млрд, а контекстное окно вмещает 262 тыс. токенов. Веса выложены на Hugging Face под лицензией Apache 2.0, которая разрешает коммерческое использование. Зарубежное издание Turing Post включило Alice AI Foundation в число ключевых запусков недели.
Пётр I в шести пересказах
Претрейн — первый и самый долгий этап обучения, на котором модель читает триллионы токенов текста и учится предсказывать следующее слово. Знания о мире закладываются именно здесь.
Хороший словарь помогает читать по-русски. Чтобы модель ещё и знала то, что известно любому российскому школьнику, ей нужны факты в правильной подаче. В 2023 году исследователи Цзэюань Аллен-Чжу и Юаньчжи Ли поставили показательный опыт на 100 тыс. вымышленных биографий. Когда каждая биография встречалась в обучении в одной формулировке, модель потом правильно отвечала на вопросы о героях лишь в 9,7% случаев. С пятью разными пересказами точность выросла до 96,6%.
Яндекс взял эту идею в претрейн Alice AI Foundation и превратил строчку «Пётр I основал Санкт-Петербург в 1703 году» в набор разных текстов. Пробовали несколько форматов:
- Рассказ экскурсовода на речном трамвайчике у Петропавловской крепости;
- Стилизация под летопись в духе «повелел царь Пётр граду новому быть»;
- Вопрос с ответом о том, в каком веке основан город;
- «Шифр» , где Петербург заменён условным «серым городом»;
- Пересказ с ловушками , где рядом стоят 1698, 1700 и 1712 годы и даты легко перепутать.
В финальный рецепт вошли рерайты, стилизации и вопросы с ответами. В пробных запусках их связка с обычным повтором текстов подняла результат на фактологическом тесте на 6,9%. Потом всплыла проблема масштаба. В долгом обучении каждый факт встречается реже, и эффект таял, поэтому пересказы распространили на весь полезный фактологический веб. До релиза Яндекс успел обработать около 30% таких текстов, а сгенерированные вопросы проверяла отдельная модель с доступом к поиску.
«Это фиаско, друг» и другие сбои культурного кода
Знание фактов ещё не гарантирует, что модель почувствует язык. Исследователи из ВШЭ, МФТИ и РГГУ представили на конференции «Диалог» в 2025 году тест из 400 вопросов о русских культурных типажах и крылатых фразах, от мемов и пословиц до детских присказок. Лучший результат среди проверенных моделей показала GPT-4o, около 87%, слабейший — Mistral NeMo, около 52%.
Крылатые фразы давались всем моделям заметно хуже типажей, а лидеры чаще всего спотыкались на мемах. Они дописывали «Это фиаско, друг» вместо «братан» и ставили в пушкинские «Три девицы под окном» соседок или девчонок. Грамматически безупречно, по смыслу мимо. Переводом английских текстов такие промахи не лечатся, нужны русские тексты, в которых эти фразы живут.
Экзамены для моделей пишут по-русски
Проверять адаптацию тоже приходится своими тестами, потому что переведённый английский экзамен меряет совсем другое. Первым крупным набором стал Russian SuperGLUE 2020 года. В 2023-м Сбер вместе с Альянсом в сфере ИИ запустил MERA, открытый рейтинг из 21 задачи с закрытыми ответами, чтобы они не утекли в обучающие данные. В РАНХиГС собрали SLAVA, около 14 тыс. вопросов по истории, политологии и географии в российском контексте.
Для Alice AI Foundation Яндекс сделал собственные тесты и два из них, WikiWebFacts и HardMultiQA, выложил в открытый доступ. Сравнивали с базовыми версиями открытых моделей, в том числе с DeepSeek -V4-Flash-Base, которая в 3,5 раза больше по числу параметров:
- Факты из русскоязычных энциклопедий — 86,5 против 83,2 у DeepSeek;
- Российская культура — 86,5 против 80,7;
- Право — 49,6 против 40,5;
- История — 82,0 против 76,9.
В английском картина обратная. На школьном тесте по английскому Alice AI Foundation набрала 76,1 против 82,9 у DeepSeek, на англоязычной викторине TriviaQA — 79,0 против 89,4. Модель вышла сильной там, куда её целили, и заметно слабее в англоязычных знаниях. Результатов в MERA и других независимых рейтингах пока нет, все цифры взяты из отчёта самого Яндекса.
Акцент лечится словарём и русскими данными
Две стратегии к осени 2026-го сошлись в одной точке. Сбер и Яндекс учат модели с нуля, Т-Банк и Авито перешивают Qwen, и обе дороги начинаются со словаря. Без него модель переплачивает за русский лишними токенами на каждом шаге. Дальше всё решают данные, многократно пересказанные и написанные живым русским языком, и собственные экзамены.
У Alice AI Foundation есть заметное ограничение. Яндекс выложил только базовую версию, без обучения диалогу, и чтобы получить из неё ассистента, модель ещё нужно дообучить. Сотрудник компании в комментариях на Хабре предложил сообществу сделать это самостоятельно. Тем, кто генерирует тексты через API, перед выбором модели стоит прогнать типичную русскую статью через её токенизатор. При одинаковой цене за токен счёт за один и тот же текст у разных моделей может отличаться в разы.
Meta Platforms Inc. (владелец социальных сетей Facebook и Instagram) признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.