1 час назад
Себастьян Рашка запустил визуальный справочник архитектур LLM — от DeepSeek до GLM-5

Себастьян Рашка, автор бестселлера Build a Large Language Model (From Scratch) и рассылки Ahead of AI на 168 000 подписчиков, запустил открытый визуальный каталог архитектур больших языковых моделей — LLM Architecture Gallery. На одной странице собраны диаграммы и карточки более чем 40 моделей: от Llama 3 и DeepSeek V3 до свежих Qwen3.5, GLM-5 и Nemotron 3 Super.
Для каждой модели указаны масштаб (общее число параметров и количество активных), тип декодера (dense, sparse MoE или гибрид), алгоритм внимания (GQA, MLA, sliding-window и другие) и ключевая архитектурная особенность. Карточки ведут на config.json модели на HuggingFace, техрепорт и — для части моделей — реализацию "с нуля" из репозитория Рашки на GitHub.
Если смотреть на каталог как на карту трендов, бросаются в глаза некоторое количество вещей. Архитектура DeepSeek V3 с многоголовым латентным вниманием (MLA) и смесью экспертов (MoE) практически стала отраслевым шаблоном — ее в той или другой форме воспроизвели Mistral 3 Large, Kimi K2 и GLM-5. Классические dense-модели вытесняются разреженными MoE на крупных масштабах, а на переднем крае уже появляются гибриды с линейным вниманием: Gated DeltaNet в Qwen3.5, слои Mamba-2 в Nemotron 3 от NVIDIA, Lightning Attention в триллионном Ling 2.5 от Ant Group.
Рашка не связан ни с одной из крупных лабораторий — с 2022 года он работал в Lightning AI, а сейчас ведет независимую исследовательскую лабораторию RAIR Lab. Галерея обновляется — последнее апдейт датировано 14 марта. Баг-репорты и предложения по моделям принимаются через трекер на GitHub.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

13 минут назад
Nebius Аркадия Воложа поставит Meta⚹ мощности для ИИ на 27 млрд $
Meta Platforms Inc.⚹ заключила долгосрочное соглашение с облачным провайдером Nebius Group, основанным Аркадий Волож, о создании и предоставлении инфраструктуры для проектов в сфере искусственного инт

35 минут назад
Microsoft раскрыла подробности про ИИ-помощника на Xbox, который будет прослушивать разговоры игроков
Игровой помощник на базе искусственного интеллекта Gaming Copilot появится на консолях Xbox Series X/S к концу текущего года. Об этом сообщил менеджер по продуктам Xbox в сфере ИИ Сонали Ядав во время

40 минут назад
В платформе «Экзон» внедрили 15 сервисов на базе искусственного интеллекта
В экосистеме «Экзон» внедрили 15 функций на базе искусственного интеллекта, предназначенных для автоматизации рабочих процессов и сокращения ручных операций при работе с документацией. Об этом сообщил

41 минуту назад
Обзор: чат-боты подпитывают бредовые идеи
Психиатр и исследователь из Королевского колледжа в Лондоне Гамильтон Моррин опубликовал в журнале Lancet Psychiatry обзор существующих данных о психозе, вызванном искусственным интеллектом. В нём под

1 час назад
SimpleGen: начальный шаг в разработку на SimpleOne с помощью AI
SimpleGen — свежий средство для генерации решений на платформе SimpleOne с помощью AI. Он позволяет создавать задачи, генерировать код и конфигурацию, а также сразу деплоить изменения на ваш стенд. В