Moonshot AI выпустила Kimi K3 на 2,8 трлн параметров с контекстом до миллиона токенов

Первая открытая модель масштаба около 3 трлн параметров
Китайская Moonshot AI 16 июля представила Kimi K3 - флагманскую модель для программирования, исследований, работы с документами и других продолжительных задач. Она получила 2,8 трлн параметров и стала, по заявлению разработчика, первой открытой моделью, приблизившейся к масштабу 3 трлн параметров. Для сравнения: Kimi K2, с которой началось нынешнее поколение семейства, имела 1 трлн параметров.
Открытой Kimi K3 пока можно назвать с оговоркой. Модель уже доступна через продукты и API Moonshot AI, однако файлы для самостоятельного развёртывания на момент анонса ещё не опубликованы. Компания обещает выпустить полные веса до 27 июля вместе с более подробным техническим отчётом об архитектуре, обучении и тестировании.
Эта разница существенна. Пользователи уже могут оценить качество ответов и подключить модель к приложениям, но проверить её устройство, запустить на собственной инфраструктуре и повторить заявленные эксперименты сообщество сможет только после публикации файлов.
Миллион токенов нужен для длинной работы, а не для одного огромного запроса
Контекстное окно Kimi K3 достигает 1 048 576 токенов. В него можно поместить крупную программную базу, набор финансовых отчётов, архив технической документации или продолжительную историю работы агента. Модель также принимает текст, изображения и видео, а отвечает текстом.
На практике миллион токенов полезен там, где система должна долго сохранять рабочий контекст: помнить устройство проекта, возвращаться к ранее найденным источникам, учитывать сделанные исправления и продолжать задачу через десятки или сотни шагов. Простая загрузка огромного объёма данных сама по себе не гарантирует точного результата. Качество зависит от того, находит ли модель нужный фрагмент, удерживает ли ограничения задачи и не начинает ли противоречить собственным ранним решениям.
Moonshot AI добавила автоматическое кэширование контекста. При повторных запросах с одинаковой длинной начальной частью система может не обрабатывать весь материал заново. Для агентов, которые многократно обращаются к одной кодовой базе или набору документов, это напрямую влияет на стоимость.
Как 2,8 трлн параметров помещаются в рабочую модель
Kimi K3 построена по схеме Mixture of Experts, или «смесь экспертов». Внутри находятся сотни специализированных блоков, но для обработки каждого фрагмента текста включается только небольшая часть. Всего модель содержит 896 экспертов, из которых одновременно активируются 16.
Поэтому число 2,8 трлн не описывает объём вычислений на каждом запросе. Большая часть параметров в конкретный момент остаётся неактивной. Такой подход позволяет увеличивать общую вместимость модели без пропорционального роста расходов, хотя сама инфраструктура всё равно остаётся тяжёлой: для самостоятельного запуска Moonshot рекомендует системы как минимум с 64 ускорителями, объединёнными в один вычислительный узел.
Компания называет новую схему Stable LatentMoE. За сложным названием скрывается задача равномерно распределять работу между экспертами, чтобы несколько востребованных блоков не становились узким местом, пока остальные простаивают.
KDA ускоряет работу с длинным контекстом
Главное архитектурное изменение получило название Kimi Delta Attention. Это новый механизм внимания - части модели, которая определяет, какие элементы контекста связаны между собой и на что нужно опираться при формировании ответа.
Обычное внимание становится всё дороже по мере роста контекста: чем больше текста загружено, тем больше связей приходится учитывать. KDA объединяет классический механизм с более экономичным линейным вариантом. По данным Moonshot AI, такая схема особенно помогает при работе с длинными последовательностями, где традиционный подход расходует слишком много памяти и вычислений.
Вторая технология, Attention Residuals, меняет передачу информации между слоями модели. Вместо простого накопления результатов каждого предыдущего слоя система может выборочно возвращаться к наиболее полезным промежуточным представлениям. Разработчики описывают это как более точный способ сохранять информацию по мере прохождения через глубокую сеть.
Вместе с изменениями в обучении эти решения, по внутренней оценке Moonshot AI, дали примерно 2,5-кратный прирост эффективности масштабирования относительно Kimi K2. Речь идёт не о том, что каждый ответ формируется в 2,5 раза быстрее. Компания утверждает, что получает больше возможностей модели из сопоставимого объёма вычислений, потраченных на обучение и работу системы.
Kimi K3 рассчитана на задачи, которые продолжаются часами
Moonshot AI продвигает новинку прежде всего как модель для продолжительной самостоятельной работы. Она должна разбирать большие репозитории, пользоваться терминалом, писать и проверять код, исправлять ошибки по результатам запуска и сохранять цель на протяжении длинной последовательности действий.
В одном из демонстрационных проектов Kimi K3 создала MiniTriton - компактный компилятор для программирования GPU. По утверждению компании, система разработала собственное промежуточное представление, добавила этапы оптимизации и построила процесс генерации кода для видеоускорителей. В другом эксперименте модель в течение 48 часов проектировала и проверяла микросхему для запуска небольшой версии собственной архитектуры. Эти результаты опубликованы самой Moonshot и пока не прошли полноценную независимую проверку.
Отдельный сценарий связан с научными исследованиями. Компания сообщает, что модель изучила более 20 работ по вычислительной астрофизике, проверила свыше 300 уравнений состояния, написала более 3000 строк Python-кода и собрала интерактивную визуализацию результатов. Moonshot оценивает продолжительность работы примерно в два часа против одной-двух недель для опытного исследователя. Здесь особенно важна проверка качества: быстро построенный расчётный процесс полезен только тогда, когда специалист способен воспроизвести результаты и обнаружить возможные ошибки.
Изображения и видео становятся частью рабочего цикла
Kimi K3 получила встроенное понимание изображений и видео. В программировании модель может изучить макет или снимок экрана, написать код, посмотреть на полученный результат и внести изменения. Moonshot показывает этот подход на создании интерфейсов, браузерных 3D-игр, CAD-проектов и анимации.
В одном из примеров система собрала браузерную трёхмерную игру с процедурно созданным окружением. В другом - смонтировала рекламный ролик из 56 исходных фрагментов, подбирая сцены, переходы, ритм и обработку звука. Такие демонстрации хорошо показывают задуманное направление K3: модель должна оценивать промежуточный результат глазами и продолжать работу, а не ограничиваться разовой выдачей кода.
Показательные проекты остаются витриной, собранной разработчиком. Они подтверждают, что сценарий технически возможен, но не говорят, как часто модель справляется с ним с первой попытки, сколько требует исправлений и сколько стоит полный цикл.
В программировании K3 приблизилась к сильнейшим закрытым моделям
Moonshot AI сравнила Kimi K3 с Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 и GLM-5.2. Компания признаёт, что по общей совокупности возможностей K3 пока уступает Claude Fable 5 и GPT-5.6 Sol, но на отдельных тестах программирования и агентной работы выходит в лидеры или приближается к ним.
На Terminal Bench 2.1 модель набрала 88,3 балла против 88,8 у GPT-5.6 Sol. На Program Bench результат K3 составил 77,8, немного выше 77,6 у GPT-5.6 Sol и 76,8 у Claude Fable 5. В SWE Marathon Kimi получила 42 балла, опередив все перечисленные в таблице модели, включая Claude Opus 4.8 с 40 баллами и GPT-5.6 Sol с 39.
На FrontierSWE картина другая: K3 набрала 81,2, тогда как Claude Fable 5 получила 86,6. В DeepSWE модель Moonshot показала 67,5 против 73 у GPT-5.6 Sol и 70 у Claude Fable 5. Релиз выглядит сильным именно за счёт отсутствия одного очевидного провала, а не благодаря безоговорочному первому месту в каждой таблице.
Сравнения требуют осторожности. Разные модели запускались через разные программные оболочки: Kimi Code, Claude Code или Codex. В некоторых тестах Moonshot использовала собственную инфраструктуру и максимальный режим рассуждения. Часть результатов взята из публичных таблиц, часть получена компанией самостоятельно, а несколько тестов остаются внутренними. Такое сравнение полезно для первичной оценки, но не заменяет одинаковый независимый прогон всех моделей.

Поиск и работа с инструментами стали отдельным приоритетом
В BrowseComp, где модель должна находить труднодоступную информацию в интернете, Kimi K3 набрала 91,2 балла. На Automation Bench, проверяющем выполнение автоматизированных задач, результат составил 30,8 - выше показателей других моделей в таблице Moonshot. На SpreadsheetBench 2 K3 получила 34,8 и практически сравнялась с Claude Fable 5.
API поддерживает вызов внешних инструментов, структурированные ответы по заданной схеме и динамическую загрузку доступных функций по ходу диалога. Последняя возможность полезна для больших агентных систем: модели не приходится постоянно держать в контексте описание сотен инструментов, которыми она в конкретный момент не пользуется.
У интернет-поиска на старте есть ограничение. В документации Moonshot прямо указано, что функция обновляется и пока не рекомендуется для рабочих систем. Поэтому высокие результаты BrowseComp нельзя автоматически переносить на текущую публичную поисковую функцию API.
API дороже K2.6, но кэш снижает цену повторных запросов
Kimi K3 доступна через API по идентификатору kimi-k3. Миллион входных токенов стоит $3, миллион выходных - $15. Если длинная начальная часть запроса уже находится в кэше, цена входа снижается до $0,30 за миллион токенов. Для сравнения, Kimi K2.6 стоит $0,95 за обычный вход, $0,16 за кэшированный и $4 за выход.
Переход на K3 увеличивает базовую цену входа примерно втрое, а выхода - почти в четыре раза относительно K2.6. Платить больше имеет смысл в задачах, где модель способна довести сложную работу до результата с меньшим числом повторов и ручных исправлений. Если K3 пишет тот же фрагмент кода, который уверенно создаёт более дешёвая модель, её архитектурный масштаб превращается в лишнюю статью расходов.
Moonshot сообщает, что в задачах программирования официальный API достигает более 90% попаданий в кэш. Это показатель собственной инфраструктуры компании, а реальная доля для конкретного проекта будет зависеть от того, насколько стабильно приложение сохраняет начало контекста между вызовами.

Модель уже доступна, веса появятся позднее
Kimi K3 можно использовать на сайте Kimi и в мобильных приложениях для iOS, Android и HarmonyOS. Модель также появилась в Kimi Work версии 3.1.0 для Windows и компьютеров Mac с процессорами Apple, в терминальном помощнике Kimi Code и на API-платформе.
В Kimi Code доступ зависит от подписки. Модель включена начиная с уровня Moderato, а контекстное окно на 1 млн токенов открывается с тарифа Allegretto. Подробная международная доступность отдельных подписок и способы оплаты для пользователей из разных стран требуют отдельной проверки.
API совместим с форматом OpenAI, поэтому разработчики могут использовать привычные библиотеки и заменить адрес сервера, ключ и название модели. K3 всегда работает в режиме рассуждения; на момент запуска доступен только максимальный уровень усилий. Moonshot обещает позднее добавить другие режимы, которые позволят выбирать между скоростью, ценой и глубиной обработки.
У Kimi K3 есть три заметных ограничения
Первое ограничение связано с историей рассуждений. K3 обучали так, чтобы она получала обратно свои промежуточные рассуждения между шагами. Если приложение передаёт историю неправильно или переключает существующую сессию с другой модели на K3, качество может резко упасть. Moonshot рекомендует начинать новую сессию и использовать проверенные оболочки, включая Kimi Code.
Вторая проблема - чрезмерная самостоятельность. Модель оптимизировали под долгие сложные задачи, поэтому при неоднозначной инструкции она может принять решение за пользователя и продолжить работу в неожиданном направлении. Для корпоративных процессов это риск: чем больше прав получает агент, тем точнее должны быть ограничения, список разрешённых действий и контроль критических операций.
Третью оговорку делает сама Moonshot AI. Несмотря на конкурентные результаты, пользовательский опыт K3 пока заметно уступает Claude Fable 5 и GPT-5.6 Sol. Компания не уточняет, идёт ли речь о качестве диалога, стабильности, скорости, следовании инструкциям или сочетании этих факторов. Такая прямота полезнее привычного заявления о победе во всех категориях.
Главная проверка начнётся после 27 июля
Kimi K3 заметна сразу по трём причинам: рекордный для открытой модели масштаб, контекст до миллиона токенов и результаты, близкие к ведущим закрытым системам в программировании и агентных задачах. Moonshot также показала, зачем ей понадобилась столь крупная архитектура: модель рассчитана на проекты, которые требуют часов работы, большого объёма исходных данных и постоянной проверки промежуточного результата.
Пока значительная часть доказательств исходит от самой компании. Настоящая проверка начнётся после публикации весов и технического отчёта, когда независимые команды смогут измерить требования к оборудованию, скорость, устойчивость длинного контекста и качество на собственных задачах. Размер в 2,8 трлн параметров обеспечил Kimi K3 громкий старт. Успех модели определит более приземлённая метрика: сколько сложных работ она доводит до конца без вмешательства человека и по какой итоговой цене.