Kimi K2-0905: модель ИИ с 256K токенов и улучшенным «инструментальным разумом»
5 сентября 2025 года разработчики Kimi официально анонсировали новую версию своей языковой модели — Kimi K2-0905 , основанную на архитектуре Mixture-of-Experts (MoE) . Эта модель ориентирована на разработчиков, инженеров данных и тех, кто работает с комплексными кодовыми сценариями. В ней заметно улучшена точность, масштабируемость и интеграция с другими ИИ-инструментами.
Что нового: ключевые улучшения
Одно из самых ожидаемых обновлений — увеличение контекстного окна до 256 тысяч токенов . Это позволяет модели без проблем «удерживать в голове» большие документы, сложные цепочки команд и даже многосессионные запросы. Особенно это важно для фронтенд-разработки, где Kimi демонстрирует отличные результаты в связке с такими инструментами, как Claude Code и Roo Code .
Также было значительно улучшено управление инструментами:
По заявлениям команды, модель демонстрирует 100% точность вызова инструментов при скорости генерации от 60 до 100 токенов в секунду через турбо-API.
Производительность: сравнение с конкурентами
Результаты Kimi K2-0905 были представлены в ряде бенчмарков:
- SWE-Bench Verified — 69,2% (против 65,8% у Kimi K2-0711 и 72,7% у Claude Sonnet 4)
- SWE-Bench Multilingual — 55,9% (значительный рост по сравнению с 47,3% у предыдущей версии)
- Terminal-Bench — 44,5% (против 37,5%)
- SWE-Dev — 66,6% (было 61,9%)
Такая динамика показывает, что модель становится всё более универсальной, особенно в задачах, связанных с программированием и обработкой естественного языка на разных языках.
Инструменты, API и открытый доступ
Разработчики сделали Kimi K2-0905 максимально доступной:
- Веса модели и исходный код уже можно скачать напрямую
- Модель доступна через интерактивный чат
- Также открыт API , совместимый с популярными платформами и фреймворками
Для разработчиков это значит одно: Kimi K2-0905 уже можно интегрировать в собственные решения, не дожидаясь следующего апдейта.
Интересный факт: Архитектура Mixture-of-Experts позволяет активировать только часть модели при каждом запросе. Это экономит ресурсы и ускоряет работу, не жертвуя качеством.