DeepSeek открыла веса V4.1 Flash с контекстом в миллион токенов

DeepSeek выложила 10 сентября веса мультимодальной модели V4.1 Flash под лицензией MIT. В ней 552 млрд параметров, при генерации ответа работают 16 млрд, контекст до миллиона токенов. Более крупную V4 Pro компания снимает с обслуживания 14 сентября.
DeepSeek открыла веса V4.1 Flash с контекстом в миллион токенов

Flash в линейке DeepSeek отвечает за скорость и дешёвый прогон, рядом с ней стоит тяжёлый Pro. В новой версии у Flash поменялась сама конструкция, а релиз компания подаёт как разворот всей линейки в сторону агентных задач — долгих прогонов с инструментами, кодом и большими документами. Веса лежат на Hugging Face, в API модель называется deepseek-flash.

Миллион токенов и вчетверо меньше памяти

V4.1 Flash принимает до миллиона токенов за раз. Это примерно крупный репозиторий целиком или пара сотен страниц документации с иллюстрациями, потому что модель понимает и изображения. Основная нагрузка при такой длине приходится на KV-кэш — служебную память, где модель держит уже обработанную часть запроса, чтобы не считать её заново.

DeepSeek сократила этот кэш вчетверо по видеопамяти и в восемь раз по дисковой относительно прошлого поколения. От самой первой версии архитектуры экономия, по расчётам компании, выросла в 437 раз. Для работы с большими документами и кодом это важнее любого прироста на тестах.

Энкодер и декодер вместо одной башни

Под капотом у V4.1 Flash несимметричная схема, которую DeepSeek называет Causal Encoder-Decoder. Сорок слоёв разделены пополам. Первые двадцать разбирают вход, вторые двадцать отвечают за генерацию.

Поверх этого работает разреженная схема MoE, где на каждый токен включается лишь часть из 552 млрд параметров. На разборе запроса активны 8 млрд, на генерации 16 млрд. Отсюда и скорость. Модель формально огромная, а считает как небольшая.

Terminal-Bench 90,6% против скромного HumanEval

Сильнее всего V4.1 Flash смотрится там, где нужно долго возиться с инструментами. На агентном Terminal-Bench 2.1 компания заявляет 90,6%, на тесте правок кода DeepSWE v1.1 — 74,2% решённых задач. Классические академические замеры выглядят скромнее, 79,4% на HumanEval и 74,1% на MMLU-Pro.

Разрыв читается однозначно. Модель затачивали под агентные сценарии, и общие тесты знаний от этого выиграли мало. Все цифры на момент выхода релиза получены самой DeepSeek, независимых прогонов нет.

V4 Pro снимают с обслуживания 14 сентября

DeepSeek утверждает, что V4.1 Flash обходит более крупную V4 Pro по совокупности качества, скорости и стоимости, и подкрепляет это делом. Pro отключают 14 сентября, через четыре дня после выхода новинки. Тем, кто завязан на старую модель в продакшене, окно на переезд дали короткое.

Цена у deepseek-flash плавающая, в непиковые часы она падает вдвое относительно дневной. Приём, которым DeepSeek пользуется давно и который заметно меняет счёт тем, кто гоняет большие пакеты задач по ночам.

Что даёт лицензия MIT на практике

MIT снимает вопросы с коммерческим использованием и дообучением, дальше начинается железо. Полные веса на 552 млрд параметров домашней видеокартой не поднять, и обещанная экономия памяти масштаб не отменяет — сервер всё равно нужен.

Практичный путь для большинства — квантованные сборки под llama.cpp, Ollama и LM Studio, они появляются в первые дни после публикации весов. Второй вариант, API самой DeepSeek, обходится дешевле западных аналогов и не требует ничего, кроме ключа и способа пополнить баланс.

Открытые веса проверят быстрее закрытых

Публикация под MIT работает как страховка от собственных бенчмарков. Цифры DeepSeek пока никто не подтвердил, но веса лежат в открытом доступе, и независимые прогоны появятся своим ходом. Смотреть стоит на агентные тесты и на поведение на длинной дистанции. Заявку на миллион токенов видно только там, где кэш уже разросся, а не на первых запросах.

11:00
28
Нет комментариев. Ваш будет первым!