Как выбрать сервер для локальной LLM в 2026 году: VRAM, типы квантования и реальная скорость
Разбираем без маркетинговых штампов: сколько видеопамяти реально нужно под Llama 3.3, Qwen 2.5 и DeepSeek R1, сколько забирает KV-кэш на 32k контекста и почему шина памяти важнее терафлопсов.
Чтобы поднять открытую LLM на своем сервере, считайте VRAM по формуле: (Количество миллиардов параметров × Битность квантования / 8) × 1.25 + Память под KV-кэш. Для моделей до 14B параметров (Llama 8B, Phi-4) достаточно карты на 16 ГБ (RTX 4080/4090) или мощного VPS с 32 ГБ RAM. Для моделей класса 70B (Llama 3.3 70B, Qwen 72B) в 4-битном сжатии необходим сервер с 48 ГБ VRAM (2x RTX 4090 или 1x L40S) либо 1x A100 80GB для работы без квантования.
- Чистый вес файла весов модели — это лишь 70% нужной видеопамяти. Оставшиеся 30% съедают KV-кэш длинного контекста и буфер вычислений CUDA.
- 4-битное квантование (Q4_K_M, AWQ) теряет менее 1.5% точности, но снижает требования к VRAM в 3.5 раза по сравнению с базовым FP16.
- Для моделей 8B параметров (Llama 3.1) достаточно любой карты с 8-12 ГБ VRAM или быстрого 8-ядерного CPU с 16 ГБ RAM.
- Для моделей 70B (Llama 3.3, Qwen 2.5) минимальный порог комфорта — 48 ГБ VRAM (NVIDIA L40S или связка из двух карт RTX 4090 по 24 ГБ).
- Скорость генерации упирается не в ядра CUDA, а в пропускную способность шины памяти (Memory Bandwidth).
Сравнение расхода видеопамяти и скорости на популярных конфигурациях
| Модель | Формат весов | Требуемый VRAM | Рекомендуемый GPU | Ориентир FPS |
|---|---|---|---|---|
| Llama 3.1 8B | FP16 (без сжатия) | 16 ГБ | RTX 4090 (24GB) | 90–110 т/с |
| Llama 3.1 8B | Q4_K_M (4-bit) | 5.5 ГБ | RTX 4060 / VPS CPU | 115 т/с (GPU) / 15 т/с (CPU) |
| Qwen 2.5 Coder 32B | Q4_K_M (4-bit) | 20 ГБ | RTX 4090 (24GB) | 45–60 т/с |
| Llama 3.3 70B | Q4_K_M (4-bit) | 42 ГБ | 2x RTX 4090 или 1x L40S | 22–32 т/с |
| Llama 3.3 70B | FP8 / 8-bit | 74 ГБ | 1x A100 80GB | 35–48 т/с |
| DeepSeek R1 671B | Q4 MoE (37B active) | 80+ ГБ | 2x A100 80GB | 20–35 т/с |
Куда на самом деле уходит память видеокарты
Большинство новичков скачивают GGUF или safetensors файл размером 20 гигабайт, пытаются запустить его на видеокарте с 24 ГБ памяти и ловят ошибку CUDA Out of Memory при первом же длинном вопросе. Почему это происходит?
Память расходуется сразу по трем направлениям: сами веса нейросети, статический оверхед драйвера CUDA (около 1–2 ГБ) и так называемый KV-кэш. Ключ-значение (Key-Value) кэш хранит векторные представления всех предыдущих слов диалога, чтобы трансформеру не приходилось пересчитывать всю историю заново на каждом новом токене.
Если вы подаете на вход 100 страниц технической документации или исходный код целого проекта (контекст 32 000–64 000 токенов), один только KV-кэш может занять от 8 до 16 дополнительных гигабайт видеопамяти. Поэтому золотое правило продакшна: размер квантованной модели не должен превышать 75% от общего объема VRAM вашей карты.
Почему пропускная способность памяти (Bandwidth) важнее гигагерц
Генерация текста нейросетью — это процесс, ограниченный пропускной способностью памяти (memory-bound). Чтобы выдать всего одно следующее слово, видеокарта обязана прогнать через свои вычислительные блоки абсолютно все миллиарды весов модели.
Если модель 70B в 4-битном виде весит 40 ГБ, то для генерации одного токена нужно прочитать 40 ГБ данных. Видеокарта с пропускной способностью 1000 ГБ/с (как у RTX 4090) теоретически может прочитать эти 40 ГБ максимум 25 раз в секунду — отсюда и физический предел скорости в 25 токенов в секунду.
Серверные ускорители вроде NVIDIA A100 и H100 оснащаются памятью стандарта HBM2e и HBM3 с пропускной способностью от 2 000 до 3 350 ГБ/с. Именно поэтому на них те же самые модели выдают в 2–3 раза больше токенов в секунду даже при схожей пиковой вычислительной мощности чипа.
Какой сервер арендовать в 2026 году под разные бюджеты
Если бюджет ограничен 1 500–3 000 рублей в месяц, не гонитесь за дешевыми устаревшими GPU вроде Tesla T4 или P40. Возьмите обычный процессорный VPS с 8 vCPU и 16–32 ГБ быстрой оперативной памяти DDR5. Модели Llama 3.1 8B или Qwen 2.5 7B через движок llama.cpp на процессоре выдадут стабильные 12–18 токенов в секунду — этого с головой хватит для Telegram-бота или личного помощника.
Для серьезной разработки, автодополнения кода и средних команд идеальным выбором остается сервер с 1x RTX 4090 24GB (около 32 000–38 000 руб/мес в Timeweb Cloud или Aeza). На нем летают модели уровня Qwen 2.5 Coder 32B и Mistral Small 24B со скоростью 50–70 токенов в секунду.
Для корпоративных хранилищ знаний и работы с документами без квантования лучший выбор — аренда инстанса с NVIDIA A100 80GB в Selectel или Serverspace. Огромный объем памяти позволяет одновременно обслуживать десятки сотрудников без просадки времени отклика.
Проверенные серверы от надежных провайдеров
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Timeweb Cloud
Cloud Basic
CPU
2 ядер • 3.3 ГГц
RAM
2 ГБ
Диск
40 ГБ NVMe
Канал
200 Мбит/с
499 ₽/мес
Часто задаваемые вопросы (FAQ)
Что лучше использовать для сервера: vLLM или Ollama?
Для одного пользователя, прототипирования и несложных интеграций выбирайте Ollama — она поднимается в одну строчку и отлично справляется. Для боевых серверов с параллельными запросами выбирайте vLLM: поддержка Continuous Batching ускоряет одновременную работу нескольких пользователей в 4–8 раз.
Можно ли объединить две разные видеокарты (например 4090 и 3090)?
Да, движки вроде vLLM, TensorRT-LLM и llama.cpp поддерживают распределение слоев модели (Pipeline Parallelism и Tensor Parallelism) между несколькими картами, суммируя их VRAM. Но при разной скорости карт общая скорость генерации подстроится под более медленную.