Стартап Миры Мурати выпустил первую модель Inkling с 975 млрд параметров

Thinking Machines Lab представила Inkling - первую универсальную модель стартапа Миры Мурати. MoE-модель получила 975 млрд параметров, из которых 41 млрд активируются при обработке каждого токена, и контекстное окно до 1 млн токенов. Веса опубликованы по лицензии Apache 2.0 и доступны для скачивания.
Стартап Миры Мурати выпустил первую модель Inkling с 975 млрд параметров

MoE-архитектура активирует 41 млрд параметров из 975 млрд

Inkling построена на архитектуре «смесь экспертов» (Mixture of Experts, MoE). Для каждого токена модель задействует шесть из 256 специализированных блоков и два общих блока. Такая схема сокращает объём вычислений во время работы, хотя полный набор весов всё равно приходится хранить в памяти.

Thinking Machines обучила модель с нуля на 45 трлн токенов текста, изображений, аудио и видео. Inkling принимает текстовые запросы, изображения и аудиозаписи, умеет анализировать их совместно, но выдаёт результат только в текстовом формате. Среди заявленных сценариев - программирование, агентные системы, чат-боты, поиск по корпоративным данным и приложения с вызовом внешних инструментов.

Модель также позволяет регулировать глубину рассуждений. Разработчик может уменьшить время «размышления» ради скорости или поднять его для сложных задач. Этот параметр особенно полезен в агентных сценариях, где длинные рассуждения быстро увеличивают задержку и стоимость работы.

Веса опубликованы, а дообучение доступно через Tinker

Полные веса Inkling размещены на Hugging Face. Модель можно запускать на собственной инфраструктуре через SGLang, vLLM, TokenSpeed, Unsloth и библиотеки Hugging Face. Доступ через API предоставляют Together AI, Fireworks, Modal, Databricks и Baseten.

Для дообучения Thinking Machines предлагает платформу Tinker. На старте там доступны конфигурации с контекстом 64K и 256K токенов, поэтому заявленное окно в 1 млн токенов через собственную платформу компании пока не предоставляется. Для Inkling действует временная скидка 50%, срок её окончания не назван. Вариант на 64K стоит $1,87 за миллион входных токенов, $4,68 за миллион выходных и $5,61 за миллион токенов обучения; конфигурация на 256K обходится примерно вдвое дороже.

Формулировка «открытая модель» требует оговорки. В карточке указана лицензия Apache 2.0, однако Thinking Machines одновременно распространяет отдельную политику допустимого использования. Она ограничивает ряд сценариев и распространяется на изменённые версии модели. Поэтому точнее называть Inkling моделью с открытыми весами.

Самостоятельный запуск требует от 600 ГБ видеопамяти

Открытые веса не делают Inkling моделью для обычной рабочей станции. Полная версия в формате BF16 требует как минимум 2 ТБ суммарной видеопамяти: компания приводит конфигурации из восьми NVIDIA B300 или шестнадцати H200.

Сжатая версия NVFP4 снижает минимальное требование до 600 ГБ. Её можно запустить на четырёх B300 или восьми H200. Активные 41 млрд параметров уменьшают вычислительную нагрузку на каждый токен, но почти триллион весов всё равно превращает самостоятельное развёртывание в задачу для дата-центра или крупной корпоративной инфраструктуры.

Вместе с основной моделью компания показала предварительную версию Inkling-Small. Она получила 276 млрд параметров, из которых 12 млрд активны, и должна работать дешевле и быстрее. Thinking Machines пока обозначает её именно как preview.

По бенчмаркам Inkling пока уступает лидерам

Thinking Machines прямо признаёт, что Inkling не превосходит все закрытые и открытые модели. В опубликованной компанией таблице результаты получились смешанными. Например, в Terminal Bench 2.1 модель набрала 63,8%, тогда как Kimi K2.6 получила 71,3%, а GLM 5.2 - 82,7%. В SWE-bench Verified результат Inkling составил 77,6% против 80,2% у Kimi K2.6 и 80,6% у DeepSeek V4 Pro.

Сильнее модель выглядит в отдельных тестах на следование инструкциям, агентную работу и обработку аудио. Однако все сравнительные цифры пока исходят от самого разработчика. Для оценки качества потребуются независимые тесты, особенно после дообучения под реальные корпоративные задачи.

Inkling расширяет выбор среди крупных моделей с открытыми весами

Inkling стала первым универсальным модельным релизом Thinking Machines Lab, которую бывший технический директор OpenAI Мира Мурати основала в 2025 году. До этого компания выпустила Tinker - платформу для дообучения моделей разных разработчиков. Теперь у неё появилась собственная основа для той же экосистемы.

Релиз заметен и по географии рынка. Среди крупнейших моделей с открытыми весами сейчас особенно заметны разработки китайских лабораторий: DeepSeek, Qwen, Kimi и GLM. Inkling даёт американским компаниям ещё один вариант с доступными весами, мультимодальным вводом и официальными инструментами дообучения. Reuters также называет модель одной из немногих крупных альтернатив китайским предложениям в этом сегменте.

Метрикой успеха станут сторонние дообучения, качество агентных систем и полная стоимость эксплуатации. Одной таблицы бенчмарков для этого мало, а минимальные 600 ГБ видеопамяти заметно сужают круг тех, кто сможет воспользоваться открытыми весами без посредника.

18:15
144
Нет комментариев. Ваш будет первым!