Языковую схема на 28,9 млн параметров запустили на микроконтроллере ESP32-S3

2 мин
Языковую схема на 28,9 млн параметров запустили на микроконтроллере ESP32-S3

Разработчик Слава Сербов запустил языковую модель на 28,9 млн параметров на плате с микроконтроллером ESP32-S3. Нейросеть работает полностью локально, а сгенерированный текст выводится на небольшой дисплей.

Для эксперимента разработчик использовал ESP32-S3 N16R8 с 16 Мбайт флеш‑памяти и всего 512 Кбайт встроенной SRAM. Кроме того, процессор оснащён двумя 32-битными ядрами Xtensa LX7 с частотой до 240 МГц.

Уместить схема на устройстве с ограниченной памятью удалось благодаря четырёхбитной квантизации и распределению весов между разными типами памяти. Финальный файл занимает всего 14,9 Мбайт. При этом из 28,9 млн параметров примерно 559 тысяч относятся к вычислительному ядру, 3,1 млн — к выходному слою, а оставшиеся 25 млн хранятся во флеш‑памяти в виде таблицы послойных эмбеддингов. 

Такой решение использовали в моделях Google Gemma. Вместо загрузки сразу всей таблицы в оперативную память система извлекает только те информация, которые необходимы для текущего токена, и добавляет их на разные слои модели. В случае с ESP-32 за один шаг из флеш‑памяти считывается приблизительно шести строк таблицы. Вычислительное движок остаётся в более быстрой памяти, а выходной слой и рабочие данные — в PSRAM.

Схема для проекта обучили на TinyStories — синтетическом наборе коротких англоязычных рассказов, которые сгенерировали с помощью GPT-3.5 и GPT-4. В обучающих текстах используется преимущественно лексика, знакомая детям 3–4 лет. Итоговая модель может генерировать похожие простые рассказы для детей, но не умеет отвечать на вопросы, писать исходник и оперировать фактами о мире.

После оптимизации LLM на ESP-32 генерирует около 9,5 токенов в секунду с учётом вывода текста через последовательный оболочку. Сами вычисления выполняются со скоростью 9,73 токена в секунду. Для ускорения система заранее переводит выходной слой и активации эмбеддингов в восьмибитный формат и распределяет расчёты между двумя ядрами микроконтроллера.

Ранее разработчик Дэйв Беннетт (Dave Bennett) тоже запускал LLM на ESP32, но его способа оптимизации хватило на модель с 260 тысячами параметров.

Читают сейчас

Hugging Face представила Grabette — опенсорс‑устройство для записи манипуляций с предметами, чтобы обучать роботов

1 час назад

Hugging Face представила Grabette — опенсорс‑устройство для записи манипуляций с предметами, чтобы обучать роботов

Команда Pollen Robotics, входящая в состав Hugging Face, представила Grabette — переносное девайс для сбора данных о манипуляциях с предметами. С его помощью человек может выполнить нужное действие ру

1 час назад

Российские учёные нашли метод изучать коллективное поведение электронов в ультратонких материалах с помощью света

Группа из Российского квантового центра, Университета ИТМО и МФТИ показала, что коллективное поведение электронов в ультратонком материале можно наблюдать с помощью света. Учёные представили работу, п

Соцсеть X запустила платёжный служба X Money

2 часа назад

Соцсеть X запустила платёжный служба X Money

Соцсеть Илона Маска X запустила внутри приложения платёжный служба под названием X Money. Услуга пока доступна только подписчикам Premium или Premium+ из США. Служба предлагает мгновенные переводы по 

ЦБ РФ продолжает монополизацию рынка — правила для криптовалютных компаний убивают стартапы и небольшие компании

2 часа назад

ЦБ РФ продолжает монополизацию рынка — правила для криптовалютных компаний убивают стартапы и небольшие компании

То, что сейчас выкатывает Банк России под соусом «нормативной базы для организованных торгов цифровыми валютами», — это не правила игры. Это инструкция, как эту игру забрать у всех, кроме тех, у кого

Исследование: браузеры с ИИ‑агентами помогают обходить политику same‑origin

3 часа назад

Исследование: браузеры с ИИ‑агентами помогают обходить политику same‑origin

Учёные из Вашингтонского университета заявили, что браузеры с ИИ‑агентами пока «не готовы к использованию» из‑за проблем с безопасностью. Прежде всего речь идёт о возможности обхода политики same‑orig