DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

4 мин
DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.

Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.

В модели равным образом используется свежий Engram-модуль на 196 млрд параметров для работы с N-граммами. В сочетании с MoE это позволяет разделить часть знаний и вычислений между параметрами, которые не нужно прогонять через основную сеть на каждом токене.

Отдельно DeepSeek переработала работу с KV-cache. Для длинного контекста это одна из ключевых оптимизаций V4.1-Flash: компания заявляет заметное падение memory footprint по сравнению с предыдущим поколением. В документации схема равным образом использует QAT для KV-cache и FP4-квантизацию, что дополнительно снижает требования к памяти при инференсе.

В агентных тестах — рядом с Opus 5 и GPT-5.6 Sol

На DeepSWE v1.1 итог V4.1-Flash составляет 74,2% — это практически уровень заявленного результата Claude Opus 5 (74%) и выше показателя GPT-5.6 Sol (73%).

В Terminal-Bench 2.1 схема набирает 90,6%, а в Automation-Bench — 54,8%. В таблице DeepSeek оба результата стоят выше показателей конкурирующих моделей, с которыми организация сравнивает Flash.

При этом универсальным лидером V4.1-Flash назвать нельзя. На Terminal-Bench 3.0 и Terminal-Bench 4.0 модель получает только 30,0% и 31,2% соответственно.

Важная оговорка: опубликованные цифры — результаты самой DeepSeek.
Важная оговорка: опубликованные цифры — результаты самой DeepSeek.

Что интересно в архитектуре

V4.1-Flash выглядит продолжением той же линии, которую DeepSeek развивает с предыдущими V4-моделями: снижать стоимость инференса не за счет упрощения модели, а за счет переработки самой вычислительной схемы.

Асимметричный prefill/decode здесь особенно показателен. 8 млрд активных параметров на входе и 16 млрд на выходе — вполне необычная настройка для LLM. Она заточена под сценарии, где входной контекст может быть огромным, а генерация идет короткими последовательными шагами, как в coding agent.

Вторая интересная часть — Engram. Модель сочетает большую MoE-часть с отдельным N-граммным хранилищем параметров. Это еще один вариант вынесения части информации из основной вычислительной цепочки: некоторые закономерности можно получать через lookup-механизм, а не заставлять каждый раз восстанавливать их через глубокий проход сети.

В результате V4.1-Flash — это довольно большая схема по числу параметров, но с гораздо меньшим активным вычислительным графом на определённый токен.

Reasoning, мультимодальность и миллионный контекст

V4.1-Flash получила нативное мультимодальное понимание изображений и контекстное окно до 1 млн токенов.

Для программный интерфейс DeepSeek предлагает три уровня reasoning — low, high и max. Это уже скорее инструмент управления стоимостью агентного запуска, чем просто переключатель качества: одна и та же модель может функционировать с разным бюджетом рассуждения зависимо от сложности задачи.

Миллионный контекст при этом имеет смысл рассматривать вместе с оптимизацией KV-cache. Для агентных нагрузок длинная история — один из основных источников роста memory и latency, следовательно сам размер окна без изменений в attention-механике был бы куда менее интересен.

Цена

В непиковые часы программный интерфейс стоит $0,15 за 1 млн входных токенов без cache hit и $0,60 за 1 млн выходных. Для уже закэшированного входа тариф составляет $0,003 за 1 млн токенов. В пиковые часы цены удваиваются.

То есть DeepSeek одновременно пытается занять две позиции: дать фронтир-модель по отдельным агентным тестам и сделать сам инференс в достаточной степени дешевым для постоянных многошаговых вызовов.

Отдельно компания собирается заменить через V4.1-Flash текущий V4 Pro в api до выхода следующей Pro-версии. Это важнее обычного обновления каталога: Flash становится не просто более дешевой моделью, а практическим рабочим уровнем DeepSeek для части продакшн-нагрузок.

Открытые веса

V4.1-Flash опубликована на Hugging Face с лицензией MIT. Одновременно с релизом DeepSeek выложила техническую документацию и материалы для самостоятельного развёртывания.

Читают сейчас

Энтузиасты впаяли Molex в печатную плату NVIDIA GeForce RTX для установки в хост

21 минуту назад

Энтузиасты впаяли Molex в печатную плату NVIDIA GeForce RTX для установки в хост

Десктопные NVIDIA® GeForce RTX™ создаются в расчете на стандартные корпуса формата mid-tower или full-tower и совместимые блоки питания с разъемами PCIe. Когда возникает проблема установить подобный у

«Сбер» представил умное зеркало на базе медицинского ассистента GigaDoc

1 час назад

«Сбер» представил умное зеркало на базе медицинского ассистента GigaDoc

«Сбер» на международной промышленной выставке «Иннопром. Индия» показал умное зеркало на базе медицинского ассистента GigaDoc (проект СберМедИИ, входит в индустрию здоровья «Сбера»). Гаджет за 15 секу

«Сбер» показал GigaChat 3.5 Reasoning с режимом рассуждений

1 час назад

«Сбер» показал GigaChat 3.5 Reasoning с режимом рассуждений

«Сбер» представил новую версию своей мультимодальной нейросети GigaChat — GigaChat 3.5 Reasoning. В модели появился отдельный режим рассуждений: перед формированием ответа она разбивает задачу на этап

Некоторое количество спецслужб США выдвинули коллективные обвинения в адрес китайских ИИ‑компаний

1 час назад

Некоторое количество спецслужб США выдвинули коллективные обвинения в адрес китайских ИИ‑компаний

Агентство по кибербезопасности и защите инфраструктуры США (CISA) в сотрудничестве с Агентством национальной безопасности и Федеральным бюро расследований выпустило совместное предупреждение о кибербе

OpenClaw 2.0 появился случайно, и мы осознанно выводим его в маркетплейс отдельным образом

1 час назад

OpenClaw 2.0 появился случайно, и мы осознанно выводим его в маркетплейс отдельным образом

В прошлой статье я рассказывал, как развернуть образ OpenClaw в облаке и не слить ему все свои данные: что мы положили в образ, что сознательно не положили и где проходит граница ответственности. Счит