Яндекс открыл модель, на которой работают быстрые ответы в Поиске

Яндекс выложил в открытый доступ базовую версию модели, которая генерирует быстрые ответы под поисковой строкой. В ней 35 млрд параметров, но на каждый токен работает около 600 млн. Веса опубликованы 11 сентября под лицензией Apache 2.0.
Яндекс открыл модель, на которой работают быстрые ответы в Поиске

Alice AI Search Pretrain - предобученная основа модели, дообученная версия которой с июля отвечает пользователям Яндекс Поиска прямо под строкой запроса. Компания подаёт релиз как первый случай, когда поисковик открывает базу генератора собственных ИИ-ответов. Веса лежат на Hugging Face под именем AliceAI-T5-35B-A0.6B, лицензия разрешает коммерческое использование.

Ответ под строкой запроса читают 49 миллионов человек в месяц

Быстрые ответы - самый массовый генеративный продукт Яндекса и чаще всего первое, через что пользователь Поиска вообще сталкивается с ИИ. Их аудитория превышает 49 млн человек ежемесячно.

Требование к такому продукту жёсткое. В час пиковой нагрузки ответ должен собраться за считаные секунды, и отсюда растёт вся конструкция. Сначала система обращается к текстовому поиску и поиску по картинкам, затем отдельная маленькая модель вырезает из найденных документов только полезные куски, и уже по ним основная модель пишет ответ.

Гибрид, которого не нашлось в открытых релизах

Яндекс соединил две архитектуры. Encoder-Decoder разделяет работу на две половины, где одна разбирает поданный контекст, а вторая пишет текст. MoE добавляет разреженность, при которой модель хранит много знаний, но на каждом шаге включает лишь небольшую их часть.

Такое сочетание в современном опенсорсе практически отсутствует. Ближайшие примеры, которые называют сами разработчики, - NLLB-MoE, Switch Transformer и FLAN-MoE, все они вышли в 2021-2023 годах. Отсюда и мотив - собрать современный гибрид двух подходов и проверить, что получится.

Тридцать пять миллиардов параметров, шестьсот миллионов в работе

В модели 34,35 млрд уникальных параметров и 512 экспертов в каждом MoE-слое, из которых на каждый токен выбираются восемь. Активная часть составляет менее 2% от общего объёма. Энкодер собран из 16 слоёв, декодер из 12, контекст в конце обучения растянули с 8 до 128 тысяч токенов.

Обучали на 15 трлн токенов собственного корпуса. По ходу пришлось менять способ распределения токенов между экспертами, потому что при масштабировании балансировка в энкодере разваливалась. Команда перешла на схему без вспомогательной функции потерь, позаимствованную у DeepSeek -V3, и обучение стабилизировалось.

Qwen 3.5 35B-A3B выигрывает десять строк из тринадцати

Яндекс честно публикует таблицу, из которой видно, где модель сильна, а где нет. Alice AI лидирует в трёх строках из тринадцати, на двух собственных тестах фактологии (68,0 и 81,3) и на Ruler 32K (94,7). В остальных десяти впереди Qwen 3.5 35B-A3B, и разрыв местами заметный. На MATH 500 это 81,9 против 62,9, на HumanEval - 88,3 против 69,3.

Тот же расклад в слепом сравнении после одинакового дообучения всех участников:

  • против Qwen 3.5 2B - 77% побед;
  • против T5 Gemma 2 4B-4B - 69%;
  • против Qwen 3.5 4B - 54%;
  • против Qwen 3.5 35B-A3B - 44%, то есть проигрыш.

Аргумент разработчиков в этом месте - стоимость инференса, потому что Qwen сопоставимого качества значительно тяжелее в работе. Проверить это со стороны нельзя, все замеры сделаны во внутренней инфраструктуре Яндекса. Против Google AI Overview заявлено 56,7% побед, онлайн-эксперимент дал прирост сессий на пользователя в 0,34%.

Маленькая модель на 80 миллионов параметров экономит 40% пропускной способности

Самое любопытное в релизе Яндекса стоит рядом с основной моделью. Экстрактор инфоконтекстов - крошечная модель на 80 млн параметров, обученная с нуля на 4 трлн токенов. Её работа сводится к тому, чтобы выбросить из найденных документов всё, что не пригодится для ответа.

Сокращение входа дало примерно 40% прироста пропускной способности без потери качества. Для сервиса с такой нагрузкой это более осязаемый результат, чем лишний процент на бенчмарке.

Что нужно, чтобы запустить веса у себя

Архитектура нестандартная, поэтому модель грузится только с флагом trust_remote_code=True, а вход собирается вручную со служебными токенами в стиле UL2 - привычный текстовый промпт сюда не подставить. Для дообучения в репозитории лежит готовый пример на Transformers и LoRA. Оптимизированный production-инференс остался внутри Яндекса, снаружи доступен только вариант через Hugging Face Transformers.

Открыта основа, продуктовое дообучение осталось внутри

Опубликована именно база. Дообучение, на котором держится продуктовое качество, состав корпуса и разметка остались закрытыми, так что повторить быстрые ответы Яндекса по этим весам не получится. Ценность релиза в другом. Компактная активная часть и длинный контекст делают модель удобной заготовкой под собственные задачи поверх поиска по документам.

Сами авторы оговариваются, что выигрыш их архитектуры привязан к сценарию - по мере ускорения обычных decoder-only моделей баланс качества и скорости может сместиться. Опенсорсная ставка на схему, от которой индустрия отошла три года назад, тем и интересна, что проверить её теперь может кто угодно.

12:25
35
Нет комментариев. Ваш будет первым!