27 августа 2026, 16:30
Зачем пересылать гигабайты? Как Samsung встроила вычисления прямо в банки памяти LPDDR5X-PIM


На Hot Chips 2026 Samsung представила LPDDR5X-PIM — внешне обычную LPDDR5X, внутри которой в каждом банке стоят MAC-деревья. На инференсе Llama 3.1 8B это дало х3,01 по токенам в секунду (81,3 против 27,0) и х2,28 по времени выполнения (5,4 секунды против 12,3), а эффективная полоса выросла с 76,8 ГБ/с до 614 ГБ/с.
Как это устроено
Логика встроена в каждый банк памяти: регистровые файлы VRF и SRF плюс деревья умножителей-накопителей. Процессор умеет работать в двух режимах, как обычная DRAM и как многобанковый PIM.
Главная инженерная задача в адресации. Строки DRAM физически не разложены так, как их хочет видеть матричное умножение, и переупорядочивание данных съедает весь выигрыш. Samsung решает это через Address Align Mode. Это такой режим, который отображает адреса DRAM прямо на MAC-инструкции.
А вот форм-фактор не поменялся. Стандартный 561-шариковый корпус, модули на 16 ГБ. То есть в теории это бесшовная замена, а не новый класс устройств со своей обвязкой.
8× полосы — но это не та полоса

Цифру 614 ГБ/с легко ознакомиться (или понять) неправильно. Это не пропускная способность шины до процессора, тут шина осталась прежней. Это эффективная полоса внутри памяти, доступная тем операциям, которые выполняются на месте и не требуют вывода данных наружу. Выигрыш возникает ровно там, где нагрузка упирается в перекачку весов, — то есть на memory-bound инференсе с батчем, близким к единице.
Почему выигрыш вообще возможен, видно из арифметики декодирования. При генерации каждого следующего токена с батчем, равным единице, модель обязана прочитать все свои веса полностью, а полезных вычислений на прочитанный байт приходится ничтожно мало. Скорость упирается в то, как быстро веса доедут до него по шине, — ускоритель большую часть времени просто ждет. Отсюда и разрыв в измерениях Samsung, 27,0 токена в секунду на обычной LPDDR5X против 81,3 на PIM при одном и том же вычислителе.
Пиковая мощность при работе PIM подскакивает, но суммарное потребление, в соответствии с заявлению компании, «без существенного роста» и в результате ниже, чем у обычной DRAM за счет сокращения трафика. Логика та же — перемещение байта по шине стоит дороже, чем умножение.
Зачем это Samsung именно сейчас
Контекст читается легко, HBM дорожает и остается дефицитным. Если часть нагрузки удается снять на дешевую LPDDR с логикой внутри, у вендора появляется вторая линейка продаж вместо конкуренции по одному фронту. Стандартизацию Samsung двигает уже через следующее поколение: спецификацию LPDDR6X-PIM организация рассчитывает провести через JEDEC в этом году, по срокам самой LPDDR5X-PIM ясности нет.
Стоит помнить, что это не начальный заход. HBM-PIM и Aquabolt-XL Samsung показывала еще в 2021, и до массового продукта та история не дошла. Разница в том, что тогда PIM искал задачу, а сейчас рынок сам требует — инференс на устройстве.
Оговорки
Одна из серьезных оговорок — точность вывода на PIM отличается от базовой версии. Samsung над этим еще работает. Для рекомендательных систем и голосовых ассистентов расхождение может быть терпимым, для чего-то, где считают деньги или диагноз, — нет.
Вторая: измерения сделаны на edge-ускорителе с моделью на восемь млрд параметров. Это честный скрипт для смартфона, но переносить множители на серверный инференс не стоит — там батч крупный, веса читаются один раз на много запросов, и узкое место переезжает с весов на KV-кэш. PIM в текущем виде эту часть задачи не решает.
Третья — MAC-деревья внутри памяти умеют не все. Attention, нормализации, нелинейности по-прежнему считает сервер, а значит компилятор должен уметь резать граф и раскладывать его между двумя исполнителями с разными правилами адресации. Это ровно та работа, на которой спотыкались все предыдущие поколения PIM.
Почему на это стоит просматривать и в серверном контексте
Прямого переноса в стойку нет, но направление считывается. Индустрия последние два года двигает вычисления ближе к данным на всех уровнях сразу: HBM с логикой в базовом кристалле, near-memory processing в ускорителях, вынос части операций в сеть. LPDDR5X-PIM — самая дешевая точка этого спектра, и именно поэтому у нее есть шанс на объем. LPDDR производится десятками миллионов модулей, а HBM остается дефицитным и дорогим.
Если стандартизация состоится и PIM доедет хотя бы до сегмента инференс-серверов на ARM, у части нагрузок появится альтернатива схеме «докупить еще карту, чтобы модель влезла в память». Пока это гипотеза, но гипотеза с опубликованными измерениями.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому api‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Читают сейчас

5 часов назад
Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов
Команда Prusa Research выпустила первую публичную альфа‑версию слайсера PrusaSlicer 3.0. Авторы переписали интерфейс, переработали систему профилей, добавили поддержку полноценной работы с несколькими

6 часов назад
Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1
Anthropic выпустила апдейт своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в цело

6 часов назад
Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента
Creality представила 3D‑принтер SPARKX i8 с поддержкой четырёхцветной печати. Его главная особенность заключается в системе QuarTeks, в которой прутки филамента подведены практически к самому соплу, б

6 часов назад
Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти
Автор YouTube‑канала UFD Tech рассказал, что MacBook Neo необычно быстро расходует источник SSD‑накопителя. Всё дело в небольшом объёме оперативной памяти, из‑за которой устройство активно записывает

6 часов назад
Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО
Организация Anthropic предупредила, что инфостилеры перехватывают сеансы Claude и открывают злоумышленникам доступ к учётным записям пользователей. Читать далее