DeepSeek671 млрд параметровОкно контекста: 128k токенов

Сервер для DeepSeek R1 (Reasoning): требования к VRAM, железу и расчет цен

Революционная рассуждающая (reasoning) модель с архитектурой MoE (Mixture of Experts). Выдает развернутую цепочку размышлений (Chain-of-Thought) уровня OpenAI o1. Полный технический разбор для инженеров, вебмастеров и бизнеса: сколько памяти нужно под веса и KV-кэш, на каких видеокартах модель показывает максимальный FPS и как не переплачивать за хостинг.

Краткая спецификация оборудования
VRAM (4-bit Q4)80 ГБ
VRAM (FP16 / 8-bit)160 ГБ
Системная RAM128+ ГБ
Рекомендуемый GPUКластер от 2x NVIDIA A100 80GB / H100 80GB

Выберите нейросеть для подбора оборудования

Алгоритм рассчитает вес модели, требуемый VRAM под разное квантование и подберет серверы с минимальной ценой

Разработчик:
Размер:
DeepSeek671 млрд параметровКонтекст: 128k токенов

DeepSeek R1 (Reasoning)

Революционная рассуждающая (reasoning) модель с архитектурой MoE (Mixture of Experts). Выдает развернутую цепочку размышлений (Chain-of-Thought) уровня OpenAI o1.

Математика и логикаАудит сложного кодаАрхитектурное планированиеНаучные исследования
Минимум VRAM (Q4)
80 ГБ VRAM
Для 4-bit квантования (AWQ/GGUF)
Рекомендуемый VRAM
160 ГБ VRAM
Для FP8 / FP16 и длинного контекста
Системная RAM
128+ ГБ RAM
От 32 ядер vCPU
Место на NVMe
400+ ГБ NVMe
Для весов модели, Ollama и ОС
Ориентир скорости: 20–35 т/с на кластере из 2-4x A100/H100 (квант Q4_K_M / FP8)Полный вес требует кластера серверов. Для одиночного развертывания используется дистиллированная версия DeepSeek-R1-Distill-Llama-70B (требует 42 ГБ VRAM) либо квантованный MoE на мощных GPU-нодах.
Команда для мгновенного запуска в Ollama:
ollama run deepseek-r1:70b
СЕРВЕРЫ ИЗ КАТАЛОГА ПОД DEEPSEEK R1 (REASONING)

Рекомендуемые конфигурации с гарантией совместимости

Проверенные провайдеры РФ и Европы
TI
Timeweb CloudОптимально (квант Q4_K_M)
Тариф: GPU A100 80GBМосква
80 ГБ VRAM — влезает 4-битная версия модели с запасом под буфер.
CPU32 vCPU
RAM128 ГБ
ДИСК1024 ГБ NVMe
GPUNVIDIA A100 (80GB)
Скорость⚡ Оптимальная скорость
Стоимость129 999 ₽/мес
Развернуть
SE
SelectelОптимально (квант Q4_K_M)
Тариф: GPU Cloud H100 80GBМосква
80 ГБ VRAM — влезает 4-битная версия модели с запасом под буфер.
CPU32 vCPU
RAM256 ГБ
ДИСК2048 ГБ NVMe
GPUNVIDIA H100 (80GB)
Скорость⚡ Оптимальная скорость
Стоимость249 999 ₽/мес
Развернуть
SE
SelectelИдеально для FP16 / FP8
Тариф: GPU Cluster 4x H100 80GBМосква
320 ГБ VRAM — достаточно для длинного контекста без квантования.
CPU128 vCPU
RAM1024 ГБ
ДИСК4096 ГБ NVMe
GPUNVIDIA H100 (80GB)
Скорость🚀 Максимальная скорость
Стоимость949 999 ₽/мес
Развернуть
SE
SelectelИдеально для FP16 / FP8
Тариф: GPU Cluster 8x H100 80GBМосква
640 ГБ VRAM — достаточно для длинного контекста без квантования.
CPU256 vCPU
RAM2048 ГБ
ДИСК8192 ГБ NVMe
GPUNVIDIA H100 (80GB)
Скорость🚀 Максимальная скорость
Стоимость1 899 999 ₽/мес
Развернуть

Для каких задач лучше всего подходит DeepSeek R1 (Reasoning)?

Модель разработана компанией DeepSeek и включает 671 млрд параметров. Благодаря архитектуре глубоких трансформеров и обучению на обширном корпусе текстов модель демонстрирует высокую точность в следующих сценариях:

  • Математика и логика — минимальный процент галлюцинаций и четкое следование контексту.
  • Аудит сложного кода — минимальный процент галлюцинаций и четкое следование контексту.
  • Архитектурное планирование — минимальный процент галлюцинаций и четкое следование контексту.
  • Научные исследования — минимальный процент галлюцинаций и четкое следование контексту.

Особенности квантования и потребления памяти

Полный вес требует кластера серверов. Для одиночного развертывания используется дистиллированная версия DeepSeek-R1-Distill-Llama-70B (требует 42 ГБ VRAM) либо квантованный MoE на мощных GPU-нодах.

Оценка скорости генерации

20–35 т/с на кластере из 2-4x A100/H100 (квант Q4_K_M / FP8). Обратите внимание, что скорость зависит не только от вычислительных ядер CUDA, но и в первую очередь от пропускной способности шины памяти (Memory Bandwidth). Именно поэтому видеокарты с быстрой памятью GDDR6X (RTX 4090) или HBM2e/HBM3 (A100/H100) генерируют токены в разы быстрее серверов на обычной DDR4/DDR5 памяти.

Инструкция по быстрому запуску на сервере

Самый быстрый и надежный способ запустить DeepSeek R1 (Reasoning) на арендованном сервере — использовать бесплатный движок Ollama:

# 1. Установка Ollama в Linux (Ubuntu/Debian)curl -fsSL https://ollama.com/install.sh | sh
# 2. Скачивание и запуск моделиollama run deepseek-r1:70b
# 3. Тест API (OpenAI-совместимый эндпоинт на порту 11434)curl http://localhost:11434/api/generate -d '{"model":"deepseek-r1:70b","prompt":"Привет! Назови 3 главных плюса сервера на NVMe"}'

Часто задаваемые вопросы по DeepSeek R1 (Reasoning)

Сколько видеопамяти (VRAM) нужно для DeepSeek R1 (Reasoning)?

Для 4-битного квантования (Q4_K_M / AWQ) требуется минимум 80 ГБ VRAM. Для 8-битного или FP16 режима рекомендуется от 160 ГБ VRAM.

Можно ли запустить DeepSeek R1 (Reasoning) без видеокарты на обычном CPU?

Для комфортной интерактивной работы модели с 671 млрд параметров запуск на CPU не рекомендуется из-за низкой скорости (1–3 токена в секунду). Рекомендуется использовать видеокарты уровня Кластер от 2x NVIDIA A100 80GB / H100 80GB.

Какой сервер лучше арендовать: с помесячной или почасовой оплатой?

Если вы только тестируете модель или запускаете периодическую пакетную обработку, выгоднее взять GPU с почасовой тарификацией (например, в Selectel или Serverspace). Для постоянной работы корпоративного бота или RAG-системы выгоднее помесячная аренда (в Timeweb Cloud или Aeza), где скидка на длительный срок доходит до 20–30%.