Схема, которую «строил ИИ». Китайская NaiveAI открыла схема под лицензией MIT

3 мин
Схема, которую «строил ИИ». Китайская NaiveAI открыла схема под лицензией MIT

27 сентября пекинский стартап NaiveAI опубликовал на Hugging Face модель Naive-N0.5-Flash. Это MoE на 309 млрд параметров, из которых на каждый токен работают 15,5 млрд, с нативным контекстом в миллион токенов и лицензией MIT. 

Компания делает акцент на том, что схема «построена ИИ-центричными исследованиями». Мне этот маркетинг кажется наименее интересной частью релиза. Самое ценное в нем — архитектура, в которой нет ни одного слоя полного внимания.

Кто это

NaiveAI возглавляет Цзифэн Дай, доцент Университета Цинхуа. Раньше он работал в Microsoft Research Asia и SenseTime и известен работами по компьютерному зрению и мультимодальным моделям. Сам стартап-компания оценен в 1,4 млрд $. Схема построена поверх открытой базы MiMo-V2.5 от Xiaomi. Разработчики прямо за счётт команду MiMo, DeepSeek — за оформление разреженного внимания и SGLang — за инференс.

Архитектура

В модели 48 слоев. 39 из них используют скользящее окно внимания (SWA) шириной всего 128 токенов. Оставшиеся девять работают на облегченном DeepSeek Sparse Attention (DSA): специальный индексатор выбирает для каждого запроса топ-2048 токенов из всего контекста. Дообучение шло на 3,25 трлн токенов, и все время на полном миллионном контексте. Сначала 50 млрд токенов ушло на прогрев индексатора, потом 3 трлн — на обучение разреженного внимания, затем 200 млрд — на затухание learning rate.

Если прикинуть на пальцах, 39 слоев из 48 хранят KV-кэш только для 128 последних токенов. Длинная хранилище целиком живет в девяти DSA-слоях, это меньше пятой части стека. Моя оценка такая: по памяти под KV на длинном контексте модель должна быть в разы экономнее классической архитектуры с полным вниманием в каждом слое. Для инференса на миллионе токенов именно эта материал расходов обычно и решает, сколько запросов влезет в одну карту.

Что с цифрами

Сравнительных бенчмарков в виде таблиц с сырыми значениями в карточке модели нет, только графики. Независимых замеров пока тоже нет. Скорость компания приводит по-разному. В карточке значится «до 2 000 токенов в секунду» в режиме Ultrafast на собственном движке NaiveRT. 

RuntimeWire уточняет, что пиковые 2 122 ток/с получены на восьми GPU в одном потоке и взяты как лучшее секундное окно на 41 запросе с генерацией HTML и SVG. Для пресс-релиза такой замер подходит хорошо, а реальную нагрузку описывает плохо. Типовой режим, по данным карточки, выдает приблизительно 50 токенов в секунду. Планируемая цена программный интерфейс — 0,10 $ за миллион входных токенов и 0,40 $ за миллион выходных.

Тезис про «ИИ-центричную разработку» тоже ничем не измерен. Компания пишет, что модели писали исходник, запускали эксперименты и следили за результатами, а люди задавали цели и критерии. Какую долю работы сделали агенты, не раскрыто.

Контекст рынка

Выпуск попадает в очень удачный момент для открытых весов. По свежему индексу Vercel AI Gateway, в августе открытые модели обработали 56% всех токенов шлюза, против 7% в декабре. Одновременно по деньгам их доля всего 14%, а 64% трат уходит Anthropic. Токены массово уезжают на дешевые открытые модели, деньги пока остаются у закрытых.

Стоит ожидать, что в ближайший месяц появятся независимые замеры на RULER и аналогах. Если качество на миллионе токенов подтвердится, гибрид SWA и разреженного внимания быстро станет стандартом для открытых моделей среднего размера. Скепсис у меня вызывает другое. База MiMo-V2.5 устарела буквально за неделю: Xiaomi уже 22 сентября выпустила MiMo-V2.6. Скорость, с которой китайские открытые модели надстраиваются друг над другом, сейчас важнее любой отдельной модели.

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому программный интерфейс‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

Читают сейчас

Kuaishou анонсировала Kling 4.0 – схема выйдет в октябре

25 минут назад

Kuaishou анонсировала Kling 4.0 – схема выйдет в октябре

Китайский техногигант Kuaishou официально показал следующую итерацию своей модели для генерации видео — Kling 4.0. В условиях гонки с другими ИИ-видеогенераторами азиатские авторы делают ставку на нат

HomeBody управляет гуманоидом Unitree G1 через GPT-6 Astra

47 минут назад

HomeBody управляет гуманоидом Unitree G1 через GPT-6 Astra

27 сентября команда Movement Lab Стэнфордского университета наряду с коллегами из Caltech опубликовала HomeBody — систему, где универсальная мультимодальная схема GPT-6 Astra от OpenAI напрямую управл

OpenClaw прошёл аудит безопасности: специалисты нашли и подтвердили 23 уязвимости

59 минут назад

OpenClaw прошёл аудит безопасности: специалисты нашли и подтвердили 23 уязвимости

Команда OpenClaw завершила масштабный аудит безопасности. За тестирование отвечала организация Trail of Bits в рамках инициативы OpenAI Patch the Planet. Всего специалисты передали разработчикам 27 за

В списке МВД с профессиями иностранцев для трудоустройства вне квоты в РФ есть инженеры-программисты и программисты

1 час назад

В списке МВД с профессиями иностранцев для трудоустройства вне квоты в РФ есть инженеры-программисты и программисты

МВД РФ составило список профессий иностранцев для работы в России без ограничения по численности (трудоустроиться вне квот). Имеющие специальности из этого списка иностранцы могут функционировать в РФ

JetBrains выпустили Air Teams для работы с AI-агентами

1 час назад

JetBrains выпустили Air Teams для работы с AI-агентами

JetBrains представили Air Teams, совокупный рабочий контур для разработчиков и AI-агентов. Служба уже доступен бизнес-клиентам компании. Доступ для индивидуальных пользователей обещают добавить позже.