Яндекс открыл модель, на которой работают быстрые ответы в Поиске
Alice AI Search Pretrain - предобученная основа модели, дообученная версия которой с июля отвечает пользователям Яндекс Поиска прямо под строкой запроса. Компания подаёт релиз как первый случай, когда поисковик открывает базу генератора собственных ИИ-ответов. Веса лежат на Hugging Face под именем AliceAI-T5-35B-A0.6B, лицензия разрешает коммерческое использование.
Ответ под строкой запроса читают 49 миллионов человек в месяц
Быстрые ответы - самый массовый генеративный продукт Яндекса и чаще всего первое, через что пользователь Поиска вообще сталкивается с ИИ. Их аудитория превышает 49 млн человек ежемесячно.
Требование к такому продукту жёсткое. В час пиковой нагрузки ответ должен собраться за считаные секунды, и отсюда растёт вся конструкция. Сначала система обращается к текстовому поиску и поиску по картинкам, затем отдельная маленькая модель вырезает из найденных документов только полезные куски, и уже по ним основная модель пишет ответ.
Гибрид, которого не нашлось в открытых релизах
Яндекс соединил две архитектуры. Encoder-Decoder разделяет работу на две половины, где одна разбирает поданный контекст, а вторая пишет текст. MoE добавляет разреженность, при которой модель хранит много знаний, но на каждом шаге включает лишь небольшую их часть.
Такое сочетание в современном опенсорсе практически отсутствует. Ближайшие примеры, которые называют сами разработчики, - NLLB-MoE, Switch Transformer и FLAN-MoE, все они вышли в 2021-2023 годах. Отсюда и мотив - собрать современный гибрид двух подходов и проверить, что получится.
Тридцать пять миллиардов параметров, шестьсот миллионов в работе
В модели 34,35 млрд уникальных параметров и 512 экспертов в каждом MoE-слое, из которых на каждый токен выбираются восемь. Активная часть составляет менее 2% от общего объёма. Энкодер собран из 16 слоёв, декодер из 12, контекст в конце обучения растянули с 8 до 128 тысяч токенов.
Обучали на 15 трлн токенов собственного корпуса. По ходу пришлось менять способ распределения токенов между экспертами, потому что при масштабировании балансировка в энкодере разваливалась. Команда перешла на схему без вспомогательной функции потерь, позаимствованную у DeepSeek -V3, и обучение стабилизировалось.
Qwen 3.5 35B-A3B выигрывает десять строк из тринадцати
Яндекс честно публикует таблицу, из которой видно, где модель сильна, а где нет. Alice AI лидирует в трёх строках из тринадцати, на двух собственных тестах фактологии (68,0 и 81,3) и на Ruler 32K (94,7). В остальных десяти впереди Qwen 3.5 35B-A3B, и разрыв местами заметный. На MATH 500 это 81,9 против 62,9, на HumanEval - 88,3 против 69,3.
Тот же расклад в слепом сравнении после одинакового дообучения всех участников:
- против Qwen 3.5 2B - 77% побед;
- против T5 Gemma 2 4B-4B - 69%;
- против Qwen 3.5 4B - 54%;
- против Qwen 3.5 35B-A3B - 44%, то есть проигрыш.
Аргумент разработчиков в этом месте - стоимость инференса, потому что Qwen сопоставимого качества значительно тяжелее в работе. Проверить это со стороны нельзя, все замеры сделаны во внутренней инфраструктуре Яндекса. Против Google AI Overview заявлено 56,7% побед, онлайн-эксперимент дал прирост сессий на пользователя в 0,34%.
Маленькая модель на 80 миллионов параметров экономит 40% пропускной способности
Самое любопытное в релизе Яндекса стоит рядом с основной моделью. Экстрактор инфоконтекстов - крошечная модель на 80 млн параметров, обученная с нуля на 4 трлн токенов. Её работа сводится к тому, чтобы выбросить из найденных документов всё, что не пригодится для ответа.
Сокращение входа дало примерно 40% прироста пропускной способности без потери качества. Для сервиса с такой нагрузкой это более осязаемый результат, чем лишний процент на бенчмарке.
Что нужно, чтобы запустить веса у себя
Архитектура нестандартная, поэтому модель грузится только с флагом trust_remote_code=True, а вход собирается вручную со служебными токенами в стиле UL2 - привычный текстовый промпт сюда не подставить. Для дообучения в репозитории лежит готовый пример на Transformers и LoRA. Оптимизированный production-инференс остался внутри Яндекса, снаружи доступен только вариант через Hugging Face Transformers.
Открыта основа, продуктовое дообучение осталось внутри
Опубликована именно база. Дообучение, на котором держится продуктовое качество, состав корпуса и разметка остались закрытыми, так что повторить быстрые ответы Яндекса по этим весам не получится. Ценность релиза в другом. Компактная активная часть и длинный контекст делают модель удобной заготовкой под собственные задачи поверх поиска по документам.
Сами авторы оговариваются, что выигрыш их архитектуры привязан к сценарию - по мере ускорения обычных decoder-only моделей баланс качества и скорости может сместиться. Опенсорсная ставка на схему, от которой индустрия отошла три года назад, тем и интересна, что проверить её теперь может кто угодно.