AI & Local LLMТехнологии & Сети

Запуск локальных LLM (DeepSeek, Qwen 2.5) через vLLM и Ollama: расчет VRAM и аренда GPU-сервера

Практический гид по запуску открытых моделей DeepSeek-R1 и Qwen 2.5. Формулы точного расчета VRAM под контекст 32k, Docker-команды vLLM, PagedAttention и аренда GPU RTX 4090 / A100 в РФ с почасовой оплатой.

Обновлено: 2026-03-18
Время чтения: ~12 мин
Автор: Инженерная команда ServerSales (DevOps & Архитектура)
Быстрый ответ & Краткая суть

Для комфортного запуска открытых LLM (Qwen 2.5 7B/14B, DeepSeek-R1-Distill) с длинным контекстом (32k токенов) оптимальна аренда облачного GPU с 24 ГБ VRAM (NVIDIA RTX 4090 или L40S) по цене от 35–50 ₽/час. Для более тяжелых моделей (32B–70B) требуется 80 ГБ VRAM (NVIDIA A100 80GB или 2x RTX 4090). Для боевого продакшна используйте высокопроизводительный движок vLLM с непрерывным батчингом, а для быстрого локального теста — Ollama.

Модели 7B – 14B24 ГБ VRAM (RTX 4090 / L40S)
Модели 32B – 70B80 ГБ VRAM (NVIDIA A100 / H100)
Лучший движок (Prod)vLLM (PagedAttention, 150+ токенов/сек)
Стоимость арендыОт 35–65 ₽/час в проверенных ЦОД РФ
Рекомендуемые системные требования к серверу
Процессор (CPU)8 - 16 vCPU (Intel Xeon Scalable / AMD EPYC)
Оперативная память (RAM)32 - 64 ГБ RAM (DDR5 / ECC)
Дисковое пространство100 - 250 ГБ NVMe (для кэша весов Hugging Face)
Сеть и портыПорт от 500 Мбит/с до 1 Гбит/с
Операционная системаUbuntu 22.04 / 24.04 LTS c CUDA 12.4+
Локация ЦОДМосква, Санкт-Петербург (ЦОД Tier III Selectel / Timeweb)
Ключевые выводы и краткая суть
  • Для моделей 7B–14B достаточно одной видеокарты NVIDIA RTX 4090 (24 ГБ VRAM) при 4-битном или 8-битном квантовании (AWQ/GPTQ).
  • Движок vLLM с технологией PagedAttention увеличивает пропускную способность инференса в 3–5 раз по сравнению со стандартным Ollama.
  • Размер контекста (Context Window) критически влияет на потребление VRAM: при контексте 32k под KV-кэш требуется дополнительно от 4 до 12 ГБ памяти.
  • Почасовая аренда GPU-серверов в Selectel и Timeweb Cloud позволяет запускать вычисления от 35–60 ₽/час без покупки дорогостоящего «железа».

Матрица требований VRAM под разные размеры моделей и контекст

МодельКвантованиеКонтекст 4k (VRAM)Контекст 32k (VRAM)Рекомендуемый GPU
Qwen 2.5 7BFP16 (без сжатия)~15 ГБ~19 ГБRTX 4090 (24 ГБ)
Qwen 2.5 14B / DeepSeek 14BQ4_K_M (AWQ)~11 ГБ~16 ГБRTX 4090 (24 ГБ)
Qwen 2.5 32BQ4_K_M~20 ГБ~28 ГБA100 (80 ГБ) или 2x RTX 4090
DeepSeek-R1 70BQ4_K_M~43 ГБ~54 ГБNVIDIA A100 80 ГБ
DeepSeek-R1 671B (Full)FP8~380 ГБ~460 ГБКластер 8x H100 SXM5

Математика расчета VRAM: сколько памяти нужно на самом деле

Главная ошибка начинающих — считать, что модели 14B нужно ровно 14 ГБ памяти. На практике потребление складывается из трех слагаемых: веса модели, KV-кэш контекста и оверхед CUDA.

Формула: VRAM = (Число_параметров × Бит / 8) × 1.2 + KV_кэш. Например, 14 миллиардов параметров в 4-битном представлении занимают: 14 × 0.5 × 1.2 ≈ 8.4 ГБ чисто под модель. При отправке длинного документа на 32 000 токенов под хранение ключей и значений внимания (KV Cache) требуется еще ~6–8 ГБ. Итого нужно минимум 16–18 ГБ памяти, что идеально укладывается в карту RTX 4090 (24 ГБ).

Золотое правило экономииИспользуйте квантование AWQ или GPTQ: потеря качества по тестам MMLU составляет менее 1.2%, а требуемый объем памяти сокращается почти в 3 раза по сравнению с исходным FP16.

Шаг 1. Развертывание высокопроизводительного сервера vLLM в Docker

vLLM — лидер по скорости инференса благодаря алгоритму PagedAttention (память под токены выделяется блоками, как виртуальная память в ОС, исключая фрагментацию). vLLM предоставляет API, на 100% совместимый с OpenAI (`/v1/chat/completions`).

run-vllm.sh
# Запуск vLLM контейнера с моделью Qwen 2.5 14B Instruct AWQ
docker run --gpus all -d \
  --name vllm-server \
  -p 8000:8000 \
  --ipc=host \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  vllm/vllm-openai:latest \
  --model Qwen/Qwen2.5-14B-Instruct-AWQ \
  --quantization awq \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.92

Шаг 2. Проверка работы инференса через OpenAI API клиент

После запуска контейнера ваш сервер начинает отвечать по стандартному REST API. Вы можете подключить к нему любые сторонние интерфейсы (NextChat, Open-WebUI, Cursor, LibreChat), просто указав адрес вашего сервера и порт 8000.

test-inference.sh
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-14B-Instruct-AWQ",
    "messages": [
      {"role": "system", "content": "Ты экспертный системный администратор."},
      {"role": "user", "content": "Напиши bash-скрипт мониторинга температуры GPU."}
    ],
    "temperature": 0.3,
    "max_tokens": 512
  }'

Шаг 3. Альтернатива для быстрых тестов: запуск через Ollama

Если вам не нужен высокий параллелизм и непрерывный батчинг на 100 одновременных пользователей, а нужно просто пощупать модель локально, используйте Ollama. Она загружает модель одной командой и автоматически подбирает оптимальный слой выгрузки в GPU.

ollama-commands.sh
# Запуск Ollama с поддержкой GPU
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

# Скачивание и запуск DeepSeek R1 14B
docker exec -it ollama ollama run deepseek-r1:14b
Рекомендованные конфигурации по теме статьи

Проверенные серверы от надежных провайдеров

Весь каталог
Timeweb Cloud
Перейти
Хит цены
TI

Timeweb Cloud

Москва4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

TI

Timeweb Cloud

Москва4.8

Cloud Basic

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

40 ГБ NVMe

Канал

200 Мбит/с

499 ₽/мес

152-ФЗ
SE

Selectel

Москва4.9

Cloud Lite 1

CPU

1 ядер • 2.6 ГГц

RAM

1 ГБ

Диск

10 ГБ SSD

Канал

200 Мбит/с

550 ₽/мес

Часто задаваемые вопросы (FAQ)

Почему лучше арендовать GPU в облаке, чем покупать свою карту?

Покупка топовой RTX 4090 или A100 требует сотен тысяч рублей, специального БП от 1000 Вт и серверного охлаждения. В облаке Selectel или Timeweb вы можете арендовать GPU на 3 часа за 150 рублей, протестировать гипотезу и сразу отключить ноду.

Что быстрее: vLLM или Ollama?

Для одного пользователя скорость сопоставима (50–90 токенов/сек). Однако при поступлении нескольких параллельных запросов vLLM опережает Ollama в 4–8 раз благодаря PagedAttention и динамическому батчингу.

Можно ли запустить 70B модель на одной карте RTX 4090?

Целиком в видеопамять она не поместится даже в 4-битном квантовании (нужно от 42 ГБ). Однако при использовании Ollama часть слоев можно выгрузить в оперативную память (RAM), но скорость генерации упадет с 60 до 2–5 токенов в секунду.