2 часа назад
Удобный VRAM-калькулятор для быстрого подбора GPU-серверов


Гитара, ручка, сервер, воскресенье, фиолетовый, осень, движение — не успели записать? А откуда вы можете знать, что эта данные не понадобится вам завтра? Была бы ручка, успели бы. Все знают эту классическую байку про продажи. Но что, если перед вами не слова, а технические параметры и метрики, которые нужно быстро свести в единый бюджет на железо?
Был бы калькулятор — посчитали бы. Не каждый из нас LLMOps-инженер, который помнит наизусть, сколько весит каждая схема. Допустим, вы просто хотите запустить LLM на сервере, и вам нужно понять, какое именно железо под нее арендовать. VRAM-калькулятор дает четкий ответ на этот вопрос, сразу предлагая подходящие конфигурации из пула Selectel.
Зачем нужен свой калькулятор
На сегодняшний день существуют десятки инструментов с подобным функционалом, тем не менее их расчеты часто выдают весьма примерные значения и расходятся с реальным потреблением. Создавая свой сервис, мы постарались сделать его максимально приближенным к реальности, детально учтя специфику системного оверхеда и особенности аллокации памяти.
Такая погрешность обходится дорого:
В обычных системах превышение лимита VRAM приводит к мгновенному сбою Out of Memory и падению контейнера;
В стеке vLLM или TGI новые запросы просто встанут в очередь (K-V swapping / Eviction), что вызовет резкий увеличение задержки или полный даунтайм сервиса.
Справедливости ради нужно понимать, что фактическое потребление VRAM зависит не только от модели, но и от версии фреймворка, реализации квантования и особенностей аллокации памяти на конкретном стеке, следовательно избежать расхождений с реальностью на 100% невозможно. Но в конечном счете инструмент нужен для удобного планирования бюджета и расходов на внедрение ИИ. Его фокус — на учете скрытых параметров, что даёт возможность спланировать инфраструктуру без риска внезапного падения.
Что под капотом: как и что полагает сервис
Вместо примитивного расчета «вес модели плюс небольшой запас», калькулятор глубоко анализирует все архитектурные составляющие.

Статические веса и квантование. Учитывается базовая точность (FP16, INT8, FP4). Для инференса механизм опирается на эффективные форматы AWQ / GPTQ и FP8 (стандарт для дата-центров на Hopper и Blackwell), целиком исключая неэффективный для серверов структура GGUF.
Динамический KV-кэш. В расчет берется линейный увеличение памяти от размера батча (Max Batch Size), который остается доминирующим фактором потребления даже при использовании vLLM и PagedAttention.
Рантайм и буфер. Средство детально закладывает системный оверхед популярных фреймворков (TensorRT-LLM, vLLM, Hugging Face TGI) и выделяет страховой буфер под пиковые нагрузки.
Специфика MoE-архитектур. Учитывается архитектурная особенность моделей вроде Mixtral или DeepSeek. Хотя при вычислениях активируется только часть параметров, в хранилище загружаются все эксперты целиком, следовательно требования к VRAM остаются такими же высокими, как у плотных сетей аналогичного объема.
Прямой мэтч с инфраструктурой
Калькулятор опирается на главное правило инференса: пропускная способность памяти важнее сырой вычислительной мощности. Чтобы воспользоваться калькулятором, переходите на сайт и подобрите оптимальный конфиг под вашу модель. Помимо сайта, сервис интегрирован в панель управления и сразу подбирает оптимальное железо под ваши расчеты.
Для инференса моделей 7B–34B алгоритм предложит одиночные карты NVIDIA L40S, A10 или H100 NVL. Для сверхбольших LLM расчет идет под кластеры (например, 8x H100 или A100) с разделением через Tensor Parallelism. Также в пуле доступны конфигурации с мощными HGX B300, H200, RTX 6000 PRO и базовыми L4 или RTX 4090.
Если же текущая проблема не требует ручной сборки сервера на уровне железа, экосистема позволяет применять готовые решения. Вы можете получить доступ к ведущим мировым нейросетям по одному программный интерфейс-ключу через ИИ-Роутер.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому api‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Для самых нестандартных проектов инженеры Selectel всегда готовы провести бесплатный аудит, помочь с точными расчетами и бесшовно перенести проект на мощности провайдера.
Читают сейчас

1 минуту назад
«Золотая корона» уйдёт с европейского рынка
Зарубежная структура российского сервиса переводов «Золотая корона» — KoronaPay Europe — добровольно откажется от лицензии для работы на рынке Европы, следует из сообщения компании. Сейчас она находит

31 минуту назад
Полностью электрический самолёт X1 совершил начальный полёт
Организация Heart Aerospace провела испытания полностью электрического самолёта X1, который совершил 27-минутный полёт в северной части штата Нью‑Йорк, поднявшись на высоту 335 м. Во время первого пол

36 минут назад
Как найти свою аудиторию: ключевые слова в Авито Рекламе
Приглашаем на бесплатный вебинар для компаний и продавцов на Авито. Разберем, как работает таргетинг по ключевым словам — свежий инструмент Авито Рекламы — и расскажем, как настраивать кампании точечн

39 минут назад
В «Яндекс Электро» выпустили программа UMO для владельцев электромобилей UMO 5 и гибридных кроссоверов UMO 8
Авторы из команды «Яндекс Электро» выпустили мобильное приложение UMO на Android для владельцев электромобилей UMO 5 и гибридных кроссоверов UMO 8. Читать далее

57 минут назад
О! Хакатон возвращается: AI-задачи, миллион на кону
В третий раз мы в Островке собираем спецов, готовых испытать свои навыки в задачах тревел-теха — и побороться за денежные призы Редкая технологическая задача сегодня обходится без вопроса: «А что, есл