Запуск локальных LLM (DeepSeek, Qwen 2.5) через vLLM и Ollama: расчет VRAM и аренда GPU-сервера
Практический гид по запуску открытых моделей DeepSeek-R1 и Qwen 2.5. Формулы точного расчета VRAM под контекст 32k, Docker-команды vLLM, PagedAttention и аренда GPU RTX 4090 / A100 в РФ с почасовой оплатой.
Для комфортного запуска открытых LLM (Qwen 2.5 7B/14B, DeepSeek-R1-Distill) с длинным контекстом (32k токенов) оптимальна аренда облачного GPU с 24 ГБ VRAM (NVIDIA RTX 4090 или L40S) по цене от 35–50 ₽/час. Для более тяжелых моделей (32B–70B) требуется 80 ГБ VRAM (NVIDIA A100 80GB или 2x RTX 4090). Для боевого продакшна используйте высокопроизводительный движок vLLM с непрерывным батчингом, а для быстрого локального теста — Ollama.
- Для моделей 7B–14B достаточно одной видеокарты NVIDIA RTX 4090 (24 ГБ VRAM) при 4-битном или 8-битном квантовании (AWQ/GPTQ).
- Движок vLLM с технологией PagedAttention увеличивает пропускную способность инференса в 3–5 раз по сравнению со стандартным Ollama.
- Размер контекста (Context Window) критически влияет на потребление VRAM: при контексте 32k под KV-кэш требуется дополнительно от 4 до 12 ГБ памяти.
- Почасовая аренда GPU-серверов в Selectel и Timeweb Cloud позволяет запускать вычисления от 35–60 ₽/час без покупки дорогостоящего «железа».
Матрица требований VRAM под разные размеры моделей и контекст
| Модель | Квантование | Контекст 4k (VRAM) | Контекст 32k (VRAM) | Рекомендуемый GPU |
|---|---|---|---|---|
| Qwen 2.5 7B | FP16 (без сжатия) | ~15 ГБ | ~19 ГБ | RTX 4090 (24 ГБ) |
| Qwen 2.5 14B / DeepSeek 14B | Q4_K_M (AWQ) | ~11 ГБ | ~16 ГБ | RTX 4090 (24 ГБ) |
| Qwen 2.5 32B | Q4_K_M | ~20 ГБ | ~28 ГБ | A100 (80 ГБ) или 2x RTX 4090 |
| DeepSeek-R1 70B | Q4_K_M | ~43 ГБ | ~54 ГБ | NVIDIA A100 80 ГБ |
| DeepSeek-R1 671B (Full) | FP8 | ~380 ГБ | ~460 ГБ | Кластер 8x H100 SXM5 |
Математика расчета VRAM: сколько памяти нужно на самом деле
Главная ошибка начинающих — считать, что модели 14B нужно ровно 14 ГБ памяти. На практике потребление складывается из трех слагаемых: веса модели, KV-кэш контекста и оверхед CUDA.
Формула: VRAM = (Число_параметров × Бит / 8) × 1.2 + KV_кэш. Например, 14 миллиардов параметров в 4-битном представлении занимают: 14 × 0.5 × 1.2 ≈ 8.4 ГБ чисто под модель. При отправке длинного документа на 32 000 токенов под хранение ключей и значений внимания (KV Cache) требуется еще ~6–8 ГБ. Итого нужно минимум 16–18 ГБ памяти, что идеально укладывается в карту RTX 4090 (24 ГБ).
Шаг 1. Развертывание высокопроизводительного сервера vLLM в Docker
vLLM — лидер по скорости инференса благодаря алгоритму PagedAttention (память под токены выделяется блоками, как виртуальная память в ОС, исключая фрагментацию). vLLM предоставляет API, на 100% совместимый с OpenAI (`/v1/chat/completions`).
# Запуск vLLM контейнера с моделью Qwen 2.5 14B Instruct AWQ
docker run --gpus all -d \
--name vllm-server \
-p 8000:8000 \
--ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:latest \
--model Qwen/Qwen2.5-14B-Instruct-AWQ \
--quantization awq \
--max-model-len 32768 \
--gpu-memory-utilization 0.92Шаг 2. Проверка работы инференса через OpenAI API клиент
После запуска контейнера ваш сервер начинает отвечать по стандартному REST API. Вы можете подключить к нему любые сторонние интерфейсы (NextChat, Open-WebUI, Cursor, LibreChat), просто указав адрес вашего сервера и порт 8000.
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen2.5-14B-Instruct-AWQ",
"messages": [
{"role": "system", "content": "Ты экспертный системный администратор."},
{"role": "user", "content": "Напиши bash-скрипт мониторинга температуры GPU."}
],
"temperature": 0.3,
"max_tokens": 512
}'Шаг 3. Альтернатива для быстрых тестов: запуск через Ollama
Если вам не нужен высокий параллелизм и непрерывный батчинг на 100 одновременных пользователей, а нужно просто пощупать модель локально, используйте Ollama. Она загружает модель одной командой и автоматически подбирает оптимальный слой выгрузки в GPU.
# Запуск Ollama с поддержкой GPU
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
# Скачивание и запуск DeepSeek R1 14B
docker exec -it ollama ollama run deepseek-r1:14bПроверенные серверы от надежных провайдеров
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Timeweb Cloud
Cloud Basic
CPU
2 ядер • 3.3 ГГц
RAM
2 ГБ
Диск
40 ГБ NVMe
Канал
200 Мбит/с
499 ₽/мес
Selectel
Cloud Lite 1
CPU
1 ядер • 2.6 ГГц
RAM
1 ГБ
Диск
10 ГБ SSD
Канал
200 Мбит/с
550 ₽/мес
Часто задаваемые вопросы (FAQ)
Почему лучше арендовать GPU в облаке, чем покупать свою карту?
Покупка топовой RTX 4090 или A100 требует сотен тысяч рублей, специального БП от 1000 Вт и серверного охлаждения. В облаке Selectel или Timeweb вы можете арендовать GPU на 3 часа за 150 рублей, протестировать гипотезу и сразу отключить ноду.
Что быстрее: vLLM или Ollama?
Для одного пользователя скорость сопоставима (50–90 токенов/сек). Однако при поступлении нескольких параллельных запросов vLLM опережает Ollama в 4–8 раз благодаря PagedAttention и динамическому батчингу.
Можно ли запустить 70B модель на одной карте RTX 4090?
Целиком в видеопамять она не поместится даже в 4-битном квантовании (нужно от 42 ГБ). Однако при использовании Ollama часть слоев можно выгрузить в оперативную память (RAM), но скорость генерации упадет с 60 до 2–5 токенов в секунду.