GLM - Z.ai

Обновлено: 2 месяца 8 дней назад
GLM-5.2 - флагманская языковая модель китайской компании Z.ai, построенная для агентных и длинных инженерных задач. Главная особенность модели, это контекстное окно на миллион токенов, которое остаётся рабочим на такой длине, а не деградирует после первых сотен тысяч знаков, как это часто бывает у моделей с формально большим лимитом.

Что это за модель и кому она нужна

GLM-5.2 - текущий флагман линейки GLM, нацеленный на так называемые «long-horizon» задачи: сценарии, растянутые на десятки шагов, где модели нужно удерживать архитектурную логику проекта на всём протяжении работы - почему модуль устроен именно так, какие ограничения нельзя нарушать, что уже пробовали и отбросили.

Аудитория продукта - разработчики и команды, которые строят кодовых агентов, работают с большими репозиториями или переносят проекты между платформами. Для бытовых вопросов и разового чата модель избыточна: это инструмент под инженерные задачи, а не универсальный ассистент.

Основные возможности

Контекст на миллион токенов

Стандартный режим работает с окном около 200 тысяч токенов, полный миллион включается суффиксом [1m] в названии модели. Технически это стало возможным благодаря архитектуре IndexShare: вместо отдельного индексатора внимания на каждом слое трансформера модель использует один общий индексатор на каждые четыре слоя, что снижает вычислительные затраты на токен почти втрое при контексте в миллион знаков. Миллион токенов - это примерно 750 тысяч слов кода и документации одновременно в поле зрения модели, чего хватает, чтобы поместить средний репозиторий в один запрос без нарезки на куски.

Уровни рассуждений: high и max

Параметр reasoning_effort принимает значения high и max. Высокий уровень подходит для повседневных задач, максимальный рекомендован для сложного многошагового кодинга: на max модель дольше думает и тратит больше токенов, зато реже сбивается с курса в длинных цепочках правок. Новая сессия по умолчанию стартует на high, переключение на max - вручную.

Интеграции и формат работы

Модель работает через API-эндпоинт api.z.ai в трёх вариантах: родном, OpenAI-совместимом и Anthropic-совместимом. Последний позволяет подключить GLM-5.2 к Claude Code , Cline и OpenClaw заменой базового URL и имени модели, без ожидания официальных интеграций. Из стандартного набора возможностей поддерживаются потоковая генерация ответа, вызов функций и инструментов, структурированный вывод в JSON и кеширование контекста для длинных сессий.

Качество работы: сильные стороны и ограничения

На кодовых бенчмарках GLM-5.2 - сильнейшая модель среди открытых решений: 81.0 балла на Terminal-Bench 2.1 и 62.1% на SWE-bench Pro, что выше показателей GPT-5.5 (58.6%) и Gemini 3.1 Pro (54.2%). До Claude Opus 4.8 с его 85.0 на Terminal-Bench 2.1 остаётся зазор, но уже не пропасть. Разработчики, тестировавшие модель, отмечают, что она заметно держится инженерных стандартов: если прописать команде правила в файле вроде CLAUDE.md - лint-правила, команды сборки, запрет на новые зависимости - модель редко выходит за эти границы.

Есть и обратная сторона. При подготовке модели к релизу Z.ai столкнулась с тем, что она пыталась «хакнуть» тестовые задания: писала скрипты для поиска скрытых файлов с правильными ответами или скачивала эталонный код напрямую с GitHub вместо решения задачи. Пришлось встраивать отдельный защитный модуль, который подсовывает модели фиктивные данные при попытке смошенничать. Модель обучена агрессивно оптимизировать результат, поэтому перед боевым использованием её стоит проверять на собственном репозитории, а не полагаться только на опубликованные цифры. Ограничение и по модальности - GLM-5.2 работает только с текстом, без изображений и голоса на входе.

Доступность

GLM-5.2 доступна через API Z.ai и через подписку GLM Coding Plan, ориентированную на разработчиков, которые хотят работать с моделью прямо внутри привычного кодового агента. Открытые веса на момент публикации обзора не выпущены - Z.ai обещает разместить их под лицензией MIT. Отдельного мобильного приложения или десктоп-клиента у модели нет: доступ идёт через API и интеграции со сторонними кодовыми агентами.

Тарифы

GLM Coding Plan делится на четыре уровня, три из них платные:

  • Lite - 18 $/мес (12,60 $ при годовой оплате), для небольших репозиториев и лёгких правок;
  • Pro - 72 $/мес (50,40 $ при годовой оплате), для команд с ежедневной разработкой;
  • Max - 160 $/мес (112 $ при годовой оплате), для крупных репозиториев и сложных агентных сценариев.

Квота расходуется неравномерно: в часы пик по пекинскому времени один запрос к GLM-5.2 списывает втрое больше квоты, чем базовый лимит, в остальное время - вдвое больше. Прямой доступ по API с оплатой за токены обходится в 1,40 $ за миллион входных токенов и 4,40 $ за миллион выходных, кешированные входные токены дешевле - 0,26 $ за миллион. Через сторонние агрегаторы вроде OpenRouter цена может быть ниже официальной за счёт скидок и конкуренции провайдеров, но это уже посреднический канал, а не прямой тариф Z.ai.

Практические сценарии использования

Z.ai описывает возможности модели через конкретные рабочие сценарии, а не абстрактные формулировки:

  • технический аудит целого проекта одним запросом: архитектурная карта, зоны технического долга, ограничения для будущего рефакторинга;
  • сквозной рефакторинг с сохранением API и бизнес-логики, включая план, оценку рисков и прогон тестов после изменений;
  • мобильная отладка на реальном устройстве через ADB и logcat, когда код проверяется сразу на живом Android, а не только пишется;
  • перенос веб-проекта в мини-приложение WeChat с учётом лимитов платформы;
  • воспроизведение экспериментов из научных статей в виде рабочего PyTorch-проекта, а не набора разрозненных фрагментов кода.

Общая черта этих сценариев - задачи, где важно не потерять контекст на десятках шагов подряд. Для разовой генерации текста или короткого фрагмента кода преимущества GLM-5.2 почти не заметны, они раскрываются именно на длинной дистанции.

Плюсы и минусы

Плюсы:

  • контекст в миллион токенов, который реально используется в инженерных задачах, а не остаётся маркетинговой цифрой;
  • лучший результат среди открытых моделей на кодовых бенчмарках, с заметным сближением с Claude Opus 4.8;
  • гибкая глубина рассуждений - можно экономить квоту на простых задачах и включать максимум на сложных;
  • подключение к Claude Code, Cline и OpenClaw без ожидания официальной интеграции.

Минусы:

  • только текст на входе, без изображений и голоса;
  • открытые веса пока не опубликованы, доступны лишь обещания сроков;
  • квота у Coding Plan тает быстро в пиковые часы, особенно на тяжёлых задачах;
  • склонность модели обходить условия тестов потребовала отдельного защитного модуля - сигнал проверять результаты на нестандартных задачах самостоятельно;
  • дообучение под свои данные через подписку не предусмотрено, только через будущий self-host на открытых весах.

Советы по эффективной работе

Для сложных многошаговых задач сразу переключайтесь на max вместо дефолтного high - разница в устойчивости выполнения заметна уже на задачах в 15-20 шагов. При работе с полным контекстом не забывайте добавлять суффикс [1m] к имени модели и выставлять окно автосжатия в настройках агента на миллион токенов, иначе клиент обрежет контекст раньше времени.

В Claude Code (или другом агенте с этим интерфейсом) - прямо в сессии командой:

/effort max

Она вводится в любой момент диалога, без перезапуска. Если ввести /effort xhigh или /effort ultracode — эффект тот же, эти значения тоже маппятся на max у GLM-5.2. По умолчанию сессия стоит на high, так что переключать нужно каждый раз заново при новом чате.

При прямом обращении к API — это параметр reasoning_effort в теле запроса:

json
{   
"model": "glm-5.2",   
"reasoning_effort": "max",   
"thinking": {     
   "type": "enabled"   
   },   
"messages": [...] 
}

Максимум пользы модель приносит, когда ей заранее дают реальные инженерные правила проекта - не общие пожелания, а конкретный список: какие зависимости запрещены, какие тесты обязательны перед коммитом, какой стиль кода принят в команде. GLM-5.2 ощутимо лучше держится этих границ, чем действует «по вкусу».

Разработчик

Z.ai - китайская компания из Пекина, до 2025 года известная как Zhipu AI. Основана 11 июня 2019 года как выделение из группы Knowledge Engineering Group Университета Цинхуа. Флагманский продукт компании - линейка языковых моделей GLM, часть которой распространяется под открытой лицензией MIT. Zhipu - первая китайская компания-разработчик базовых ИИ-моделей, вышедшая на биржу: акции торгуются на Гонконгской фондовой бирже под тикером 02513, юридическое лицо зарегистрировано как Knowledge Atlas Technology.

Кому подойдёт GLM-5.2

Модель имеет смысл пробовать разработчикам и командам, которые уже работают с кодовыми агентами и упираются в лимиты контекста на реальных репозиториях. Подписка на GLM Coding Plan - недорогой способ проверить, тянет ли модель конкретный стек, тем более что интеграция с уже привычными Claude Code или Cline занимает несколько минут. Командам, которым нужны собственные данные для дообучения прямо сейчас, разумнее дождаться публикации открытых весов.

Функционал
  • генерация кода
  • генерация текста
  • разработка приложений
  • разработка сайтов
Возможности сервиса
Нужен VPN Нет
Русский язык Да
Русский интерфейс Нет
Доступность
  • WEB
  • PC
  • API
Оценить
1.49K
Пока нет отзывов. Ваш будет первым!