GigaChat 3.5 Ultra: Сбер сжал флагман и добавил линейное внимание

Сбер выложил в открытый доступ GigaChat 3.5 Ultra - новую флагманскую модель линейки на 432 млрд параметров, почти на 40% компактнее прошлого флагмана GigaChat 3.1 Ultra на 700 млрд. Главное архитектурное изменение: часть слоёв работает как классический механизм внимания MLA, часть переведена на линейное внимание GatedDeltaNet. Веса модели открыты на HuggingFace и GitVerse под лицензией MIT, а сама модель бесплатно доступна пользователям ассистента «ГигаЧат» - и в личных, и в рабочих задачах.
Как работает гибридное внимание
Обычный механизм внимания у языковых моделей на каждом новом слове заново сверяет его со всем предыдущим текстом. Чем длиннее диалог, тем больше памяти - так называемого KV-кеша - модель держит открытой. Линейное внимание устроено по-другому: сворачивает историю в состояние фиксированного размера и на каждом шаге просто дополняет его, без пересчёта всего текста заново.
В GigaChat 3.5 обычное внимание не исчезло полностью. Каждый четвёртый слой остался MLA-механизмом (сжатое представление истории диалога), остальные заменены на GatedDeltaNet - архитектуру в духе модели Qwen Next. По данным Сбера, такая связка тратит примерно в четыре раза меньше кеша на токен и помещает в тот же объём памяти в 2,14 раза больше контекста.
Что маркетинг смешивает со скоростью
Здесь полезно развести два разных эффекта. Экономия кеша в четыре раза считается по памяти. Собственно скорость генерации от линейного внимания растёт куда скромнее: на 15–25% в зависимости от длины контекста.
Основной прирост скорости даёт другой механизм - Multi-Token Prediction: модель предсказывает сразу несколько следующих токенов вместо одного. С тремя такими блоками вместо одного жадный вывод текста ускоряется до 2,2 раза. Формулировки про кратное ускорение в анонсах чаще всего описывают именно эту связку функций целиком. Одно линейное внимание такого прироста само по себе не даёт.
Меньше синтетики, больше веба в обучении
В прошлых версиях GigaChat заметную долю обучающих данных генерировала сама модель. При масштабировании до сотен миллиардов параметров такая синтетика быстро вырождается в однотипные примеры. Для версии 3.5 Сбер сделал ставку на органические тексты из веба: HTML прогнали через собственный LLM-парсер и получили чистый Markdown с сохранением таблиц и формул. Отдельно расширили набор языков программирования в обучающих данных - было 16, стало больше 600.
Позиция рядом с DeepSeek
По внутренним тестам Сбера, базовая версия GigaChat-3.5-Ultra-Base опережает DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в общих задачах, математике и коде. После полного цикла дообучения - SFT, DPO и нового этапа онлайн-обучения с подкреплением - итоговая инструктивная модель выходит на уровень DeepSeek V3.2 по метрикам, оставаясь примерно в полтора раза компактнее. Разница между «база обходит конкурента» и «финальная версия сравнима с ним» в релизных материалах обычно стирается, хотя это два разных результата.
Обучение через нестабильность
Гибридная архитектура досталась инженерам недёшево. Линейное внимание на масштабе сотен миллиардов параметров склонно к расходящимся активациям: без дополнительных механизмов стабилизации обучение может просто развалиться. Сбер добавил гейты внимания и нормализации, сэндвич-нормализацию и точечный клиппинг значений внутри MoE-слоёв. Это не косметика: без такого набора правок компания не довела бы модель до конца обучения на таком масштабе.
Кому доступна модель
GigaChat 3.5 Ultra бесплатна для пользователей ассистента «ГигаЧат» - и для личных задач, и для рабочих сценариев. Разработчики получают открытый код и веса модели для создания собственных сервисов и ИИ-агентов без ограничений лицензии MIT.
Сбер называет релиз проверкой гипотезы: можно ли довести гибридную архитектуру с линейным вниманием до сотен миллиардов параметров, не разменивая качество на скорость. По собственным замерам компании - можно. Но открытые веса на HuggingFace и GitVerse означают, что проверять это теперь будет не только Сбер: независимые бенчмарки от сообщества разработчиков покажут, держится ли обещанный баланс за пределами внутренних тестов.