GLM-5.3 без отказов сжали до трёх бит для запуска на своём сервере

Нецензурированную версию GLM-5.3 от Z.ai сжали в формат EXL3 и 1 октября выложили на Hugging Face. Модель на 753 млрд параметров теперь занимает 273 ГиБ и запускается на собственном сервере через ExLlamaV3, а по замерам автора сборки качество после сжатия почти не изменилось.
GLM-5.3 без отказов сжали до трёх бит для запуска на своём сервере

GLM-5.3 — флагманская открытая модель китайской Z.ai , и за несколько недель после релиза вокруг неё выросла цепочка сторонних сборок. Последнее звено появилось на Hugging Face 1 октября: квантованная версия GLM-5.3-UNCENSORED в формате EXL3 под движок ExLlamaV3. Сборка рассчитана на тех, кто держит большие модели на своём железе и хочет получить GLM-5.3 без отказов отвечать.

Восемь A100 и контекст на 65 тысяч токенов

Автор сборки запускал GLM-5.3 на восьми видеокартах A100 по 40 ГБ через TabbyAPI, сервер с совместимым с OpenAI интерфейсом. Слои модели разложены по картам, а длину контекста пришлось ограничить 65 536 токенами, чтобы всё поместилось в память.

Домашней видеокартой тут не обойтись. Это сборка для владельцев серверной стойки или для тех, кто арендует такую машину почасово. В комплекте оставили слой MTP, который заранее предсказывает следующие токены и помогает ускорить генерацию.

Три бита в среднем, пять бит на внимании

GLM-5.3 устроена как MoE, то есть смесь экспертов. Из 753 млрд параметров на каждом токене работает малая часть: 8 экспертов из 256 роутируемых плюс один общий, который задействован всегда. Сжатие учитывает эту схему и режет веса неравномерно.

  • Внимание и общие эксперты — 5 бит на вес;
  • Плотные слои MLP — 4 бита;
  • Роутируемые эксперты — 3 бита.

В среднем выходит 3,04 бита на вес, и вся модель занимает 273 ГиБ. Логика понятная. Роутируемые эксперты составляют основную массу весов, а каждый из них включается редко, поэтому их сжимают сильнее всего. Детали, через которые проходит каждый токен, сохраняют точнее.

Во что обошлось сжатие по замерам

Автор сравнил квант GLM-5.3 с исходной FP8-версией. KL-дивергенция, которая показывает, насколько расходятся предсказания двух моделей, составила 0,089. Перплексия выросла с 3,302 до 3,440. Чем она ниже, тем увереннее модель угадывает текст, так что потеря есть, хотя и небольшая.

Агентные способности проверили на tau2-bench, где модель выполняет задачи службы поддержки с вызовом инструментов:

  • Авиакомпания — 0,640 против 0,710 у FP8;
  • Розница — 0,482 против 0,504.

Автор оговаривается, что на таких выборках обе разницы статистически незначимы. Семь пунктов в авиазадачах всё же заметнее, чем хотелось бы. Малая выборка не доказывает ни потерю, ни её отсутствие, и перед серьёзным применением стоит прогнать свои задачи.

Отказы GLM-5.3 убрали правкой весов

Квант сделан поверх версии GLM-5.3-UNCENSORED-FP8 от команды dealignai. Отказы там сняли без дообучения и без LoRA-адаптеров: изменения вшиты прямо в тензоры модели. Описание правки лежит в файле CRACK_SURGERY.json, его перенесли в EXL3-сборку без изменений.

Dealignai сообщает о нуле жёстких отказов на наборе HarmBench из 320 запросов и о 87,43% на MMLU, что на 1,85 пункта выше исходной GLM-5.3. Эти цифры сняты с FP8-версии. Для 3-битного кванта отдельно измерены только KL, перплексия и tau2-bench.

Парсер TabbyAPI ломает 70% вызовов инструментов

Самая практическая деталь из карточки GLM-5.3-UNCENSORED-EXL3 касается работы с инструментами. Парсер glm4_5 в TabbyAPI разбирает каждое значение аргумента как JSON и не сверяется со схемой инструмента. Если строковый параметр похож на число, например номер заказа или идентификатор, он превращается в число, и инструмент отклоняет вызов.

В розничных задачах tau2-bench так падало около 70% вызовов. Лечится это правкой парсера, чтобы строковые аргументы оставались строками. Кто собирается строить на этой сборке агента, должен внести исправление до первого запуска, иначе часть провалов агента будет на счету парсера.

Фильтр ответов ставит тот, кто развернул модель

GLM-5.3-UNCENSORED распространяется под лицензией MIT, как и базовая модель. Встроенных ограничений у неё нет, и dealignai прямо перекладывает ответственность на пользователя, отдельно запрещая атаки на чужие системы и контент о реальных людях. Если сборка обслуживает бота или сервис, модерацию ответов придётся настроить самостоятельно.

У этой сборки есть собственные замеры

У большинства нецензурированных моделей на Hugging Face единственная цифра — счётчик отказов, а способности после правки никто не проверяет. GLM-5.3-UNCENSORED-EXL3 в этом смысле честнее средней сборки: для кванта сняты KL, перплексия и агентный бенчмарк, а ловушка с парсером описана до того, как в неё попали пользователи. За первые дни сборку скачали 127 раз, что для 273 ГиБ весов вполне ожидаемо. Узкий круг владельцев восьми A100 и станет первой настоящей проверкой, сохранились ли у модели агентные навыки после исправления парсера.

Источник:
18:57
29
Нет комментариев. Ваш будет первым!