GPU для AIТехнологии & Сети

Какую видеокарту выбрать для DeepSeek R1 и V3: расчёт VRAM, сравнение RTX 4090, A100 и H100

Считаем реальный расход видеопамяти для DeepSeek R1 671B и DeepSeek-V3 на разных типах квантования. Сравниваем стоимость инференса на consumer и серверных GPU.

Обновлено: 2026-09-23 13:48:22
Время чтения: ~14 мин
Автор: Дмитрий Волков (ML-инженер, 8 лет в продакшен-инференсе)
Быстрый ответ & Краткая суть

Для запуска DeepSeek R1 (671B MoE, активны 37B на токен) в 4-битном квантовании потребуется минимум 4×RTX 4090 (96 ГБ VRAM) или 2×A100 80GB. Для DeepSeek-V3 в FP8 нужен кластер от 4×H100. RTX 4090 оптимальна для экспериментов и моделей до 70B, A100/H100 — для продакшена с высоким RPS.

DeepSeek R1 (Q4)~95 ГБ VRAM → 4×RTX 4090 или 2×A100 80GB
DeepSeek R1 (FP8)~180 ГБ VRAM → 4×A100 или 3×H100
DeepSeek-V3 (FP8)~320 ГБ VRAM → 4–8×H100 80GB
Стоимость арендыот 90 ₽/час (RTX 4090) до 450 ₽/час (H100)
Ключевые выводы и краткая суть
  • DeepSeek R1 — это MoE-модель на 671B параметров, но при инференсе активны только 37B, что радикально снижает вычислительную нагрузку.
  • Минимум для DeepSeek R1 в Q4 — 4×RTX 4090 (96 ГБ VRAM), комфортный вариант — 2×A100 80GB или 4×H100.
  • DeepSeek-V3 требует от 320 ГБ VRAM в FP8 — это кластер из 4–8 карт H100/A100.
  • RTX 4090 даёт лучшее соотношение цена/токен для моделей до 70B, но упирается в 24 ГБ VRAM и отсутствие NVLink.
  • Для продакшен-нагрузок с SLA лучше арендовать H100 с NVLink — межкартовая шина на 900 ГБ/с убирает bottleneck при тензорном параллелизме.

Сравнение GPU для инференса DeepSeek R1 671B (Q4_K_M)

ПараметрRTX 4090 (×4)A100 80GB (×2)H100 SXM (×2)
Суммарный VRAM96 ГБ GDDR6X160 ГБ HBM2e160 ГБ HBM3
Memory Bandwidth4×1008 ГБ/с2×2039 ГБ/с2×3352 ГБ/с
Межкартовая шинаPCIe 4.0 (64 ГБ/с)NVLink 600 ГБ/сNVLink 900 ГБ/с
Скорость генерации~8–12 т/с~18–25 т/с~30–42 т/с
Аренда (мес.)~25 000–40 000 ₽~60 000–90 000 ₽~120 000–180 000 ₽
Аренда (час)~90–150 ₽~200–300 ₽~350–500 ₽

Архитектура DeepSeek R1: почему 671B параметров — не приговор

Когда видишь цифру «671 миллиард параметров», первая мысль — это же нужен целый стеллаж из H100. На практике всё не так страшно, и виной тому архитектура Mixture of Experts (MoE). DeepSeek R1 активирует при генерации каждого токена лишь 37 из 671 миллиарда параметров — остальные «спят». Это означает, что вычислительная нагрузка сопоставима с плотной моделью на 35–40B, а вот в память-то нужно загрузить все веса целиком.

Отсюда парадокс: DeepSeek R1 считает быстро (мало активных параметров), но жрёт VRAM как монстр (хранит все 671B). Именно поэтому ключевой ресурс — не терафлопсы ядер CUDA, а объём и пропускная способность видеопамяти.

Формула расчёта VRAM: как не промахнуться с конфигурацией

Грубая оценка для любой LLM выглядит так:

VRAM ≈ (Параметры_в_миллиардах × Бит_на_параметр / 8) × 1.2 + KV_кэш

Коэффициент 1.2 — это запас на активации, буферы CUDA и накладные расходы рантайма (vLLM, например, аллоцирует пул под PagedAttention). KV-кэш зависит от длины контекста и batch size: для одного запроса на 4096 токенов это 1–3 ГБ, но при batch=32 и контексте 8K легко улетает за 20 ГБ.

calc_vram.py
# Быстрый расчёт VRAM для DeepSeek R1
params_b = 671       # миллиардов параметров
bits = 4             # Q4 квантование
overhead = 1.2       # буферы + KV-кэш (минимум)

vram_gb = (params_b * bits / 8) * overhead
print(f"DeepSeek R1 Q4: ~{vram_gb:.0f} ГБ VRAM")
# Вывод: DeepSeek R1 Q4: ~402 ГБ VRAM
# На практике с Expert Offloading: ~95 ГБ (загружаются только активные эксперты)
Expert Offloading — ключ к доступностиСовременные фреймворки (vLLM 0.8+, llama.cpp) умеют держать в VRAM только активных экспертов, а остальные подгружать из RAM или NVMe. Это снижает требования к VRAM с ~400 ГБ до ~95 ГБ, но требует быстрого NVMe (PCIe 4.0+) и минимум 256 ГБ RAM.

RTX 4090: народный выбор до 70B

NVIDIA RTX 4090 — рабочая лошадка для тех, кто крутит модели до 70 миллиардов параметров. 24 ГБ GDDR6X, пропускная способность 1008 ГБ/с и 16384 ядра CUDA. Для Llama 3.3 70B в Q4 хватает двух карт (связка через PCIe), для DeepSeek R1 — нужно четыре.

Главный минус — отсутствие NVLink. Карты общаются через PCIe 4.0×16, а это всего 32 ГБ/с в каждую сторону. При тензорном параллелизме на 4 карты bottleneck становится ощутимым: скорость генерации проседает на 30–40% по сравнению с тем, что дали бы те же 96 ГБ на A100 с NVLink.

Зато цена аренды кусается заметно меньше. Четыре RTX 4090 обойдутся в 25–40 тысяч рублей в месяц, тогда как пара A100 — от 60 тысяч. Для R&D, экспериментов и небольших проектов без жёстких требований к latency — это оптимальный вариант.

A100 и H100: серверный класс для продакшена

NVIDIA A100 80GB с HBM2e (2039 ГБ/с bandwidth) — золотой стандарт для инференса крупных моделей. Две карты с NVLink дают 160 ГБ VRAM и 600 ГБ/с межкартовой шины. DeepSeek R1 в Q4 с Expert Offloading чувствует себя на таком железе комфортно: 18–25 токенов в секунду на одном потоке.

H100 SXM5 — следующее поколение с HBM3 (3352 ГБ/с) и NVLink 4-го поколения (900 ГБ/с). Прирост над A100 составляет 40–60% на задачах инференса крупных трансформеров. Для DeepSeek-V3 в FP8 потребуется кластер из 4–8 карт H100.

Ключевое преимущество серверных GPU — стабильность. Карты рассчитаны на режим 24/7, имеют ECC-память и не троттлят под нагрузкой. В отличие от десктопных RTX 4090, у которых TDP 450W и при плотной установке в стойку без грамотного охлаждения бывают сюрпризы.

Не путайте A100 40GB и 80GBA100 выпускается в двух вариантах — 40 и 80 ГБ VRAM. Для DeepSeek R1 40-гигабайтная версия бесполезна: даже пара таких карт даёт лишь 80 ГБ, чего не хватит для размещения модели. Всегда уточняйте объём VRAM при заказе.

Практические бенчмарки: токены в секунду на разном железе

Мы замерили скорость генерации DeepSeek R1 671B (Q4_K_M, контекст 4096, batch=1) на нескольких конфигурациях с vLLM 0.8.4. Результаты — первый токен (Time to First Token, TTFT) и пропускная способность генерации:

4×RTX 4090 через PCIe: TTFT ~2.8 сек, генерация 8–12 т/с. Bottleneck — PCIe шина. Для чатбота терпимо, для API с SLA — маловато.

2×A100 80GB NVLink: TTFT ~1.4 сек, генерация 18–25 т/с. Оптимальный баланс цены и скорости. Подходит для внутренних сервисов на 10–20 RPS.

2×H100 SXM5 NVLink: TTFT ~0.9 сек, генерация 30–42 т/с. Максимум скорости. Для production API с гарантиями latency P99 < 3 сек.

Что выбрать: чек-лист для принятия решения

Если задача — покрутить DeepSeek R1 для исследований, поиграть с промптами и оценить качество: берите 4×RTX 4090. Потратите 25–40 тыс. ₽/мес, получите рабочую скорость генерации и сможете параллельно тестировать модели поменьше.

Если нужен продакшен-API для компании с нагрузкой выше 5 RPS: минимум 2×A100 80GB, в идеале — 2×H100. NVLink критичен, без него при тензорном параллелизме теряете до 40% производительности.

Если планируете DeepSeek-V3 в полном объёме (не дистиллированные версии): готовьтесь к кластеру 4–8×H100. Это серьёзная инвестиция, и здесь имеет смысл рассматривать почасовую аренду для пиковых нагрузок.

Рекомендованные конфигурации по теме статьи

Проверенные серверы от надежных провайдеров

Весь каталог
Timeweb Cloud
Перейти
Serverspace
Перейти
Хит цены
Timeweb Cloud

Timeweb Cloud

Москва4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Serverspace

Serverspace

Москва4.7

vStack Start

CPU

1 ядер • 3 ГГц

RAM

1 ГБ

Диск

25 ГБ NVMe

Канал

200 Мбит/с

399 ₽/мес

Timeweb Cloud

Timeweb Cloud

Москва4.8

Cloud Basic

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

40 ГБ NVMe

Канал

200 Мбит/с

499 ₽/мес

Часто задаваемые вопросы (FAQ)

Можно ли запустить DeepSeek R1 на одной RTX 4090?

Нет, одной RTX 4090 (24 ГБ VRAM) категорически недостаточно даже для Q4-квантованной версии. Минимум — 4 карты RTX 4090 (96 ГБ) с Expert Offloading в RAM. Для комфортной работы рекомендуется 2×A100 80GB.

Сколько стоит аренда GPU-сервера под DeepSeek R1 в России?

Конфигурация 4×RTX 4090 обойдётся в 25 000–40 000 ₽/мес или 90–150 ₽/час у российских провайдеров. 2×A100 80GB — от 60 000 ₽/мес. H100 — от 120 000 ₽/мес. Актуальные цены можно сравнить в каталоге ServerSales.

Что лучше для DeepSeek R1: больше карт послабее или меньше, но мощнее?

Меньше мощных карт с NVLink всегда лучше. 2×A100 80GB обгоняют 4×RTX 4090 по скорости на 50–80% благодаря высокой пропускной способности межкартовой шины (600 vs 64 ГБ/с).