7 мая 2026, 10:15
Энтузиаст «выжег» microGPT Андрея Карпати в FPGA и получил 53 тыс. токенов/сек

20-летний студент факультета электроники и вычислительной техники университета Торонто Лутира Абейкун выложил на GitHub проект TALOS-V2 — реализацию трансформера microGPT Андрея Карпати, полностью собранную в железе FPGA. По описанию проекта, модель выдает приблизительно 53 000 токенов в секунду на плате размером с кредитную карту — без Python, без CUDA и без какой-либо программной прослойки.
TALOS-V2 — это RTL-реализация трансформера, в которой все компоненты модели превращены в логические ячейки чипа. Эмбеддинги, алгоритм внимания (attention), нормализация, полносвязные слои и даже механизм выборки следующего токена сидят прямо в железе: процессор сам вычисляет распределение вероятностей и выбирает следующий символ. Платформа — Intel/Altera Cyclone V (плата DE1-SoC, порядка $250–350). Веса хранятся как ROM-файлы в формате с фиксированной запятой Q4.12, управление — через переключатели и JTAG, симуляция в ModelSim детерминирована: при одном начальном значении итог повторяется бит-в-бит.
Чтобы понять, что значит "выжечь GPT в FPGA", полезно сравнить с привычной картиной. Обычно нейросеть — это веса в памяти и программа, которая их читает: процессор берет инструкцию, достает данные, перемножает, пишет результат, переходит к следующей инструкции. В TALOS-V2 этого слоя нет вообще. Веса лежат в постоянной памяти прямо на чипе, умножения и сложения выполняют логические ячейки, которые соединены проводами под конкретную архитектуру. Чип не выполняет модель — чип становится моделью. Сменить модель на другую означает пересобрать всю схему заново.
Сама идея — не академическое любопытство. В том же Торонто работает стартап Taalas, основанный в 2023 году бывшим главой Tenstorrent Любишей Баичем; в феврале 2026 года организация закрыла раунд на $169 млн (всего привлекла $219 млн). Taalas занимается ровно тем же, что Лутира на FPGA, только в кремнии и в индустриальном масштабе: их первый чип HC1 — это Llama 3.1 8B, выжженная в кристалл по техпроцессу TSMC 6 нм, со скоростью приблизительно 17 000 токенов в секунду на одного пользователя. Разница только в масштабе: TALOS-V2 — образовательный объект на 4192 параметра, HC1 — production-ускоритель для модели на 8 миллиардов параметров. Базовая идея у обоих одна: трансформер можно превратить из программы в схему — и Торонто, похоже, становится для этой идеи отдельным хабом.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

1 час назад
В проекте Roboharm три нейросети управляли роботом и выполнили опасные для жизни человека команды
Исследователи из Robocurve провели эксперимент Roboharm. в контексте которого три нейросетевые модели (GPT-6 Astra, Claude Fable 5.1 и MolmoAct2) получили функция управления роботом. ИИ давали команды
3 часа назад
Microsoft напомнила системным администраторам о сроке завершения поддержки режима IE в 2029 году
Microsoft через Центр сообщений Microsoft 365 напомнила администраторам, что режим Internet Explorer (IE) в браузере Microsoft Edge будет полностью поддерживаться как минимум до конца 2029 года. Ознак
3 часа назад
Gemini почти взломали чужую инфраструктуру: виновата снова Irregular
Причём сделала это не во время атаки на реальную инфраструктуру, а в тесте, где реальных компаний вообще не должно было быть. Инцидент произошёл ещё в мае во время тестирования Gemini на кибербезопасн
3 часа назад
Из‑за ошибки в Plex контент из облака принудительно отображается на главном экране Apple TV
Пользователи Apple TV получили апдейт клиента Plex (релиз 2026.18.0), которое привнесло ошибку. Теперь на главном экране Apple TV появляется раздел «Binge‑Worthy Shows», даже если соответствующие наст
3 часа назад
Microsoft выпустила ISO‑образ Windows 11 26H2 для тестирования
В конце прошлого месяца Microsoft выпустила версию Windows 11 26H2 на канале Release Preview программы предварительной оценки. Теперь организация начала публиковать ознакомительные ISO‑образы для тест