Языковую схема на 28,9 млн параметров запустили на микроконтроллере ESP32-S3

2 мин
Языковую схема на 28,9 млн параметров запустили на микроконтроллере ESP32-S3

Разработчик Слава Сербов запустил языковую модель на 28,9 млн параметров на плате с микроконтроллером ESP32-S3. Нейросеть работает полностью локально, а сгенерированный текст выводится на небольшой дисплей.

Для эксперимента разработчик использовал ESP32-S3 N16R8 с 16 Мбайт флеш‑памяти и всего 512 Кбайт встроенной SRAM. Кроме того, процессор оснащён двумя 32-битными ядрами Xtensa LX7 с частотой до 240 МГц.

Уместить схема на устройстве с ограниченной памятью удалось благодаря четырёхбитной квантизации и распределению весов между разными типами памяти. Финальный файл занимает всего 14,9 Мбайт. При этом из 28,9 млн параметров примерно 559 тысяч относятся к вычислительному ядру, 3,1 млн — к выходному слою, а оставшиеся 25 млн хранятся во флеш‑памяти в виде таблицы послойных эмбеддингов. 

Такой решение использовали в моделях Google Gemma. Вместо загрузки сразу всей таблицы в оперативную память система извлекает только те информация, которые необходимы для текущего токена, и добавляет их на разные слои модели. В случае с ESP-32 за один шаг из флеш‑памяти считывается приблизительно шести строк таблицы. Вычислительное движок остаётся в более быстрой памяти, а выходной слой и рабочие данные — в PSRAM.

Схема для проекта обучили на TinyStories — синтетическом наборе коротких англоязычных рассказов, которые сгенерировали с помощью GPT-3.5 и GPT-4. В обучающих текстах используется преимущественно лексика, знакомая детям 3–4 лет. Итоговая модель может генерировать похожие простые рассказы для детей, но не умеет отвечать на вопросы, писать исходник и оперировать фактами о мире.

После оптимизации LLM на ESP-32 генерирует около 9,5 токенов в секунду с учётом вывода текста через последовательный оболочку. Сами вычисления выполняются со скоростью 9,73 токена в секунду. Для ускорения система заранее переводит выходной слой и активации эмбеддингов в восьмибитный формат и распределяет расчёты между двумя ядрами микроконтроллера.

Ранее разработчик Дэйв Беннетт (Dave Bennett) тоже запускал LLM на ESP32, но его способа оптимизации хватило на модель с 260 тысячами параметров.

Читают сейчас

Сотрудникам Micron на Тайване выплатят от 35 до 68 окладов по итогам года

25 минут назад

Сотрудникам Micron на Тайване выплатят от 35 до 68 окладов по итогам года

Компания Micron объявила, что её сотрудники на Тайване получат бонусы в размере от 35 до 68 месячных окладов за 2026 финансовый год. При этом минимальная денежная выплата составит 1,7 млн ​​тайваньски

Немецкая полиция читает и сохраняет переписку в WhatsApp** и Signal

45 минут назад

Немецкая полиция читает и сохраняет переписку в WhatsApp** и Signal

Журналисты netzpolitik.org получили секретный документ Таможенного криминального управления Германии (ZKA), в соответствии с которому полиция ещё в 2023 году тестировала способ «клонирования аккаунтов

Выпуск языка программирования Julia 1.13

3 часа назад

Выпуск языка программирования Julia 1.13

10 сентября 2026 года состоялся выпуск языка программирования Julia 1.13. Проект сочетает в себе такие качества как высокая производительность, поддержка динамической типизации и встроенные средства д

Версия GIMP 3.2.6

4 часа назад

Версия GIMP 3.2.6

10 сентября 2026 года состоялся версия открытого графического редактора GIMP 3.2.6 (release GIMP 3.2.6). Открытый редактор GIMP создаётся уже более 29 лет в качестве альтернативы программному обеспече

Международная съезд «Искусственный интеллект в нейронауках» в Плехановском университете

11 часов назад

Международная съезд «Искусственный интеллект в нейронауках» в Плехановском университете

исходная гиперссылка на официальную новость. Идет трехдневный форум на стыке промышленности, медицины и искусственного интеллекта. Съезд объединила исследователей динамики сложных систем, математиков,