Сбер представил GFusion - языковую модель, которая отвечает быстрее GigaChat3

GFusion меняет сам принцип генерации текста
Большинство современных языковых моделей, включая ChatGPT и GigaChat, создают ответ постепенно - слово за словом. GFusion использует другой подход. Она сначала формирует небольшой фрагмент текста целиком, а затем за несколько проходов уточняет его, исправляя менее удачные варианты.
Такой способ пока остаётся экспериментальным, но позволяет выполнять часть работы параллельно. Именно за счёт этого разработчики рассчитывают сократить время генерации ответа.
Новую модель не создавали с нуля
В основе GFusion лежит открытая модель GigaChat3-10B-A1.8B-base. Команда не обучала совершенно новую LLM, а адаптировала уже существующую архитектуру под новый способ генерации текста.
После этого модель прошла несколько этапов дообучения: ей увеличили максимальный объём контекста, улучшили выполнение пользовательских инструкций и дополнительно настроили механизм выбора наиболее уверенных вариантов ответа.
Такой путь оказался значительно проще, чем полное обучение новой модели с нуля.
Скорость выросла, но качество немного снизилось
По результатам внутренних тестов Сбера, GFusion работает примерно на 70% быстрее оригинальной GigaChat3 в сценарии с одним пользователем на ускорителе NVIDIA H100. По сравнению с версией GigaChat3, использующей технологию MTP, прирост скорости составил около 39%.
Разработчики при этом не скрывают компромисс. Качество ответов немного снизилось - примерно на 2–4 процентных пункта в используемых ими тестах. Авторы считают, что этот баланс можно менять настройками генерации в зависимости от задачи.
Именно здесь будет проходить главная проверка технологии. Для большинства пользователей важнее получить более точный ответ на несколько десятых секунды позже, чем быстрый, но менее качественный результат.
Модель учится оценивать собственную уверенность
Чтобы ускорение не приводило к большому числу ошибок, разработчики добавили дополнительный этап обучения. Во время него модель учится лучше определять, насколько уверена в каждом фрагменте будущего ответа.
Если уверенность высокая, система быстрее завершает генерацию. Если возникают сомнения, отдельные части текста пересчитываются ещё раз. Такой механизм позволил повысить скорость без серьёзной потери качества.
Проект уже открыт для сообщества
Сбер опубликовал две версии GFusion на Hugging Face под лицензией MIT. Вместе с моделями доступны описание обучения и изменения, необходимые для запуска через SGLang.
Команда также выложила собственные оптимизации для процесса обучения, которые ускоряют работу с длинными текстами. Часть этих изменений пока оформлена в виде открытых pull request и ещё не вошла в основные версии проектов.
Почему этот релиз интересен
GFusion пока сложно назвать заменой привычным языковым моделям. Это скорее исследовательская площадка, которая показывает, что крупные LLM можно ускорять не только новым оборудованием или оптимизацией кода, но и изменением самого процесса генерации текста.
Если подобный подход подтвердит свою эффективность в реальных сервисах, будущие языковые модели смогут отвечать быстрее без существенного увеличения вычислительных ресурсов. Пока говорить о смене поколения LLM рано, но интерес к таким архитектурам заметно растёт, и GFusion стала одной из самых крупных открытых работ в этом направлении.