AI ИнфраструктураТехнологии & Сети

Как выбрать сервер для локальной LLM в 2026 году: VRAM, типы квантования и реальная скорость

Разбираем без маркетинговых штампов: сколько видеопамяти реально нужно под Llama 3.3, Qwen 2.5 и DeepSeek R1, сколько забирает KV-кэш на 32k контекста и почему шина памяти важнее терафлопсов.

Обновлено: 2026-09-18
Время чтения: ~9 мин
Автор: Михаил Романов (MLOps инженер & архитектор инференса)
Быстрый ответ & Краткая суть

Чтобы поднять открытую LLM на своем сервере, считайте VRAM по формуле: (Количество миллиардов параметров × Битность квантования / 8) × 1.25 + Память под KV-кэш. Для моделей до 14B параметров (Llama 8B, Phi-4) достаточно карты на 16 ГБ (RTX 4080/4090) или мощного VPS с 32 ГБ RAM. Для моделей класса 70B (Llama 3.3 70B, Qwen 72B) в 4-битном сжатии необходим сервер с 48 ГБ VRAM (2x RTX 4090 или 1x L40S) либо 1x A100 80GB для работы без квантования.

Модели 8B (Llama 3.1)от 6–8 ГБ VRAM (или VPS с 16GB RAM)
Модели 32B (Qwen Coder)от 20–24 ГБ VRAM (1x RTX 4090)
Модели 70B (Llama 3.3)от 42–48 ГБ VRAM (2x 4090 или L40S)
Флагманы MoE (DeepSeek)от 80–160 ГБ VRAM (кластер A100/H100)
Ключевые выводы и краткая суть
  • Чистый вес файла весов модели — это лишь 70% нужной видеопамяти. Оставшиеся 30% съедают KV-кэш длинного контекста и буфер вычислений CUDA.
  • 4-битное квантование (Q4_K_M, AWQ) теряет менее 1.5% точности, но снижает требования к VRAM в 3.5 раза по сравнению с базовым FP16.
  • Для моделей 8B параметров (Llama 3.1) достаточно любой карты с 8-12 ГБ VRAM или быстрого 8-ядерного CPU с 16 ГБ RAM.
  • Для моделей 70B (Llama 3.3, Qwen 2.5) минимальный порог комфорта — 48 ГБ VRAM (NVIDIA L40S или связка из двух карт RTX 4090 по 24 ГБ).
  • Скорость генерации упирается не в ядра CUDA, а в пропускную способность шины памяти (Memory Bandwidth).

Сравнение расхода видеопамяти и скорости на популярных конфигурациях

МодельФормат весовТребуемый VRAMРекомендуемый GPUОриентир FPS
Llama 3.1 8BFP16 (без сжатия)16 ГБRTX 4090 (24GB)90–110 т/с
Llama 3.1 8BQ4_K_M (4-bit)5.5 ГБRTX 4060 / VPS CPU115 т/с (GPU) / 15 т/с (CPU)
Qwen 2.5 Coder 32BQ4_K_M (4-bit)20 ГБRTX 4090 (24GB)45–60 т/с
Llama 3.3 70BQ4_K_M (4-bit)42 ГБ2x RTX 4090 или 1x L40S22–32 т/с
Llama 3.3 70BFP8 / 8-bit74 ГБ1x A100 80GB35–48 т/с
DeepSeek R1 671BQ4 MoE (37B active)80+ ГБ2x A100 80GB20–35 т/с

Куда на самом деле уходит память видеокарты

Большинство новичков скачивают GGUF или safetensors файл размером 20 гигабайт, пытаются запустить его на видеокарте с 24 ГБ памяти и ловят ошибку CUDA Out of Memory при первом же длинном вопросе. Почему это происходит?

Память расходуется сразу по трем направлениям: сами веса нейросети, статический оверхед драйвера CUDA (около 1–2 ГБ) и так называемый KV-кэш. Ключ-значение (Key-Value) кэш хранит векторные представления всех предыдущих слов диалога, чтобы трансформеру не приходилось пересчитывать всю историю заново на каждом новом токене.

Если вы подаете на вход 100 страниц технической документации или исходный код целого проекта (контекст 32 000–64 000 токенов), один только KV-кэш может занять от 8 до 16 дополнительных гигабайт видеопамяти. Поэтому золотое правило продакшна: размер квантованной модели не должен превышать 75% от общего объема VRAM вашей карты.

Осторожно с длинным контекстомЕсли планируете RAG или скармливание больших файлов, обязательно используйте квантование KV-кэша (в vLLM и llama.cpp флаг --kv-cache-dtype fp8), это сэкономит до половины оперативной памяти контекста без потери связности ответа.

Почему пропускная способность памяти (Bandwidth) важнее гигагерц

Генерация текста нейросетью — это процесс, ограниченный пропускной способностью памяти (memory-bound). Чтобы выдать всего одно следующее слово, видеокарта обязана прогнать через свои вычислительные блоки абсолютно все миллиарды весов модели.

Если модель 70B в 4-битном виде весит 40 ГБ, то для генерации одного токена нужно прочитать 40 ГБ данных. Видеокарта с пропускной способностью 1000 ГБ/с (как у RTX 4090) теоретически может прочитать эти 40 ГБ максимум 25 раз в секунду — отсюда и физический предел скорости в 25 токенов в секунду.

Серверные ускорители вроде NVIDIA A100 и H100 оснащаются памятью стандарта HBM2e и HBM3 с пропускной способностью от 2 000 до 3 350 ГБ/с. Именно поэтому на них те же самые модели выдают в 2–3 раза больше токенов в секунду даже при схожей пиковой вычислительной мощности чипа.

Какой сервер арендовать в 2026 году под разные бюджеты

Если бюджет ограничен 1 500–3 000 рублей в месяц, не гонитесь за дешевыми устаревшими GPU вроде Tesla T4 или P40. Возьмите обычный процессорный VPS с 8 vCPU и 16–32 ГБ быстрой оперативной памяти DDR5. Модели Llama 3.1 8B или Qwen 2.5 7B через движок llama.cpp на процессоре выдадут стабильные 12–18 токенов в секунду — этого с головой хватит для Telegram-бота или личного помощника.

Для серьезной разработки, автодополнения кода и средних команд идеальным выбором остается сервер с 1x RTX 4090 24GB (около 32 000–38 000 руб/мес в Timeweb Cloud или Aeza). На нем летают модели уровня Qwen 2.5 Coder 32B и Mistral Small 24B со скоростью 50–70 токенов в секунду.

Для корпоративных хранилищ знаний и работы с документами без квантования лучший выбор — аренда инстанса с NVIDIA A100 80GB в Selectel или Serverspace. Огромный объем памяти позволяет одновременно обслуживать десятки сотрудников без просадки времени отклика.

Рекомендованные конфигурации по теме статьи

Проверенные серверы от надежных провайдеров

Весь каталог
Timeweb Cloud
Перейти
Serverspace
Перейти
Хит цены
TI

Timeweb Cloud

Москва4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

SE

Serverspace

Москва4.7

vStack Start

CPU

1 ядер • 3 ГГц

RAM

1 ГБ

Диск

25 ГБ NVMe

Канал

200 Мбит/с

399 ₽/мес

TI

Timeweb Cloud

Москва4.8

Cloud Basic

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

40 ГБ NVMe

Канал

200 Мбит/с

499 ₽/мес

Часто задаваемые вопросы (FAQ)

Что лучше использовать для сервера: vLLM или Ollama?

Для одного пользователя, прототипирования и несложных интеграций выбирайте Ollama — она поднимается в одну строчку и отлично справляется. Для боевых серверов с параллельными запросами выбирайте vLLM: поддержка Continuous Batching ускоряет одновременную работу нескольких пользователей в 4–8 раз.

Можно ли объединить две разные видеокарты (например 4090 и 3090)?

Да, движки вроде vLLM, TensorRT-LLM и llama.cpp поддерживают распределение слоев модели (Pipeline Parallelism и Tensor Parallelism) между несколькими картами, суммируя их VRAM. Но при разной скорости карт общая скорость генерации подстроится под более медленную.