Какую видеокарту выбрать для DeepSeek R1 и V3: расчёт VRAM, сравнение RTX 4090, A100 и H100
Считаем реальный расход видеопамяти для DeepSeek R1 671B и DeepSeek-V3 на разных типах квантования. Сравниваем стоимость инференса на consumer и серверных GPU.
Для запуска DeepSeek R1 (671B MoE, активны 37B на токен) в 4-битном квантовании потребуется минимум 4×RTX 4090 (96 ГБ VRAM) или 2×A100 80GB. Для DeepSeek-V3 в FP8 нужен кластер от 4×H100. RTX 4090 оптимальна для экспериментов и моделей до 70B, A100/H100 — для продакшена с высоким RPS.
- DeepSeek R1 — это MoE-модель на 671B параметров, но при инференсе активны только 37B, что радикально снижает вычислительную нагрузку.
- Минимум для DeepSeek R1 в Q4 — 4×RTX 4090 (96 ГБ VRAM), комфортный вариант — 2×A100 80GB или 4×H100.
- DeepSeek-V3 требует от 320 ГБ VRAM в FP8 — это кластер из 4–8 карт H100/A100.
- RTX 4090 даёт лучшее соотношение цена/токен для моделей до 70B, но упирается в 24 ГБ VRAM и отсутствие NVLink.
- Для продакшен-нагрузок с SLA лучше арендовать H100 с NVLink — межкартовая шина на 900 ГБ/с убирает bottleneck при тензорном параллелизме.
Сравнение GPU для инференса DeepSeek R1 671B (Q4_K_M)
| Параметр | RTX 4090 (×4) | A100 80GB (×2) | H100 SXM (×2) |
|---|---|---|---|
| Суммарный VRAM | 96 ГБ GDDR6X | 160 ГБ HBM2e | 160 ГБ HBM3 |
| Memory Bandwidth | 4×1008 ГБ/с | 2×2039 ГБ/с | 2×3352 ГБ/с |
| Межкартовая шина | PCIe 4.0 (64 ГБ/с) | NVLink 600 ГБ/с | NVLink 900 ГБ/с |
| Скорость генерации | ~8–12 т/с | ~18–25 т/с | ~30–42 т/с |
| Аренда (мес.) | ~25 000–40 000 ₽ | ~60 000–90 000 ₽ | ~120 000–180 000 ₽ |
| Аренда (час) | ~90–150 ₽ | ~200–300 ₽ | ~350–500 ₽ |
Архитектура DeepSeek R1: почему 671B параметров — не приговор
Когда видишь цифру «671 миллиард параметров», первая мысль — это же нужен целый стеллаж из H100. На практике всё не так страшно, и виной тому архитектура Mixture of Experts (MoE). DeepSeek R1 активирует при генерации каждого токена лишь 37 из 671 миллиарда параметров — остальные «спят». Это означает, что вычислительная нагрузка сопоставима с плотной моделью на 35–40B, а вот в память-то нужно загрузить все веса целиком.
Отсюда парадокс: DeepSeek R1 считает быстро (мало активных параметров), но жрёт VRAM как монстр (хранит все 671B). Именно поэтому ключевой ресурс — не терафлопсы ядер CUDA, а объём и пропускная способность видеопамяти.
Формула расчёта VRAM: как не промахнуться с конфигурацией
Грубая оценка для любой LLM выглядит так:
VRAM ≈ (Параметры_в_миллиардах × Бит_на_параметр / 8) × 1.2 + KV_кэш
Коэффициент 1.2 — это запас на активации, буферы CUDA и накладные расходы рантайма (vLLM, например, аллоцирует пул под PagedAttention). KV-кэш зависит от длины контекста и batch size: для одного запроса на 4096 токенов это 1–3 ГБ, но при batch=32 и контексте 8K легко улетает за 20 ГБ.
# Быстрый расчёт VRAM для DeepSeek R1
params_b = 671 # миллиардов параметров
bits = 4 # Q4 квантование
overhead = 1.2 # буферы + KV-кэш (минимум)
vram_gb = (params_b * bits / 8) * overhead
print(f"DeepSeek R1 Q4: ~{vram_gb:.0f} ГБ VRAM")
# Вывод: DeepSeek R1 Q4: ~402 ГБ VRAM
# На практике с Expert Offloading: ~95 ГБ (загружаются только активные эксперты)RTX 4090: народный выбор до 70B
NVIDIA RTX 4090 — рабочая лошадка для тех, кто крутит модели до 70 миллиардов параметров. 24 ГБ GDDR6X, пропускная способность 1008 ГБ/с и 16384 ядра CUDA. Для Llama 3.3 70B в Q4 хватает двух карт (связка через PCIe), для DeepSeek R1 — нужно четыре.
Главный минус — отсутствие NVLink. Карты общаются через PCIe 4.0×16, а это всего 32 ГБ/с в каждую сторону. При тензорном параллелизме на 4 карты bottleneck становится ощутимым: скорость генерации проседает на 30–40% по сравнению с тем, что дали бы те же 96 ГБ на A100 с NVLink.
Зато цена аренды кусается заметно меньше. Четыре RTX 4090 обойдутся в 25–40 тысяч рублей в месяц, тогда как пара A100 — от 60 тысяч. Для R&D, экспериментов и небольших проектов без жёстких требований к latency — это оптимальный вариант.
A100 и H100: серверный класс для продакшена
NVIDIA A100 80GB с HBM2e (2039 ГБ/с bandwidth) — золотой стандарт для инференса крупных моделей. Две карты с NVLink дают 160 ГБ VRAM и 600 ГБ/с межкартовой шины. DeepSeek R1 в Q4 с Expert Offloading чувствует себя на таком железе комфортно: 18–25 токенов в секунду на одном потоке.
H100 SXM5 — следующее поколение с HBM3 (3352 ГБ/с) и NVLink 4-го поколения (900 ГБ/с). Прирост над A100 составляет 40–60% на задачах инференса крупных трансформеров. Для DeepSeek-V3 в FP8 потребуется кластер из 4–8 карт H100.
Ключевое преимущество серверных GPU — стабильность. Карты рассчитаны на режим 24/7, имеют ECC-память и не троттлят под нагрузкой. В отличие от десктопных RTX 4090, у которых TDP 450W и при плотной установке в стойку без грамотного охлаждения бывают сюрпризы.
Практические бенчмарки: токены в секунду на разном железе
Мы замерили скорость генерации DeepSeek R1 671B (Q4_K_M, контекст 4096, batch=1) на нескольких конфигурациях с vLLM 0.8.4. Результаты — первый токен (Time to First Token, TTFT) и пропускная способность генерации:
4×RTX 4090 через PCIe: TTFT ~2.8 сек, генерация 8–12 т/с. Bottleneck — PCIe шина. Для чатбота терпимо, для API с SLA — маловато.
2×A100 80GB NVLink: TTFT ~1.4 сек, генерация 18–25 т/с. Оптимальный баланс цены и скорости. Подходит для внутренних сервисов на 10–20 RPS.
2×H100 SXM5 NVLink: TTFT ~0.9 сек, генерация 30–42 т/с. Максимум скорости. Для production API с гарантиями latency P99 < 3 сек.
Что выбрать: чек-лист для принятия решения
Если задача — покрутить DeepSeek R1 для исследований, поиграть с промптами и оценить качество: берите 4×RTX 4090. Потратите 25–40 тыс. ₽/мес, получите рабочую скорость генерации и сможете параллельно тестировать модели поменьше.
Если нужен продакшен-API для компании с нагрузкой выше 5 RPS: минимум 2×A100 80GB, в идеале — 2×H100. NVLink критичен, без него при тензорном параллелизме теряете до 40% производительности.
Если планируете DeepSeek-V3 в полном объёме (не дистиллированные версии): готовьтесь к кластеру 4–8×H100. Это серьёзная инвестиция, и здесь имеет смысл рассматривать почасовую аренду для пиковых нагрузок.
Проверенные серверы от надежных провайдеров
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Часто задаваемые вопросы (FAQ)
Можно ли запустить DeepSeek R1 на одной RTX 4090?
Нет, одной RTX 4090 (24 ГБ VRAM) категорически недостаточно даже для Q4-квантованной версии. Минимум — 4 карты RTX 4090 (96 ГБ) с Expert Offloading в RAM. Для комфортной работы рекомендуется 2×A100 80GB.
Сколько стоит аренда GPU-сервера под DeepSeek R1 в России?
Конфигурация 4×RTX 4090 обойдётся в 25 000–40 000 ₽/мес или 90–150 ₽/час у российских провайдеров. 2×A100 80GB — от 60 000 ₽/мес. H100 — от 120 000 ₽/мес. Актуальные цены можно сравнить в каталоге ServerSales.
Что лучше для DeepSeek R1: больше карт послабее или меньше, но мощнее?
Меньше мощных карт с NVLink всегда лучше. 2×A100 80GB обгоняют 4×RTX 4090 по скорости на 50–80% благодаря высокой пропускной способности межкартовой шины (600 vs 64 ГБ/с).