Спецпроект Llama 3Технологии & Сети

Сколько VRAM нужно для запуска Llama 3 70B: полный гайд по квантованию (GGUF, AWQ, EXL2) и выбору GPU

Исчерпывающее руководство по подбору видеокарт для одной из самых популярных открытых нейросетей Llama 3 70B. Разбираем разницу между форматами квантования GGUF, AWQ и EXL2, влияние на качество и точные требования к VRAM.

Обновлено: 2026-09-22
Время чтения: ~9 мин
Автор: Михаил Романов (MLOps инженер & архитектор инференса)
Быстрый ответ & Краткая суть

Для комфортного запуска Llama 3 70B в 4-битном квантовании (AWQ или EXL2) с небольшим контекстом потребуется минимум 40-42 ГБ VRAM. Идеальным железом для этой задачи станут 2x NVIDIA RTX 4090 (24GB) или 1x NVIDIA L40S (48GB). Формат GGUF (4-bit) позволяет перенести часть вычислений на оперативную память сервера (RAM), но скорость генерации значительно упадет.

Требуемый VRAM (4-bit)~40-42 ГБ
Оптимальное железо2x RTX 4090 или 1x L40S
Лучший формат для сервераAWQ (с движком vLLM)
Лучший формат для скоростиEXL2
Ключевые выводы и краткая суть
  • Оригинальная Llama 3 70B в FP16 требует более 140 ГБ видеопамяти. Без квантования её запуск обходится слишком дорого.
  • Формат GGUF (для llama.cpp) отлично подходит для смешанного (CPU+GPU) инференса, когда не хватает VRAM.
  • Формат AWQ (vLLM) — стандарт для серверов. 4-битный AWQ снижает вес 70B до ~38 ГБ без заметной потери качества.
  • Формат EXL2 (ExLlamaV2) — лучший выбор для максимальной скорости (т/с) на одном или нескольких GPU, поддерживает дробное квантование (например, 4.5 bpw).

Сравнение форматов квантования для Llama 3 70B

ФорматБитрейтВес файлаТребуемый VRAM (с кэшем)Плюсы
Без сжатия (FP16)16-bit~140 ГБ~155 ГБИдеальное качество
GGUF (Q4_K_M)4-bit~41 ГБОт 8 ГБ (остальное в RAM)Оффлоадинг на процессор
AWQ4-bit~38 ГБ~42 ГБСтандарт vLLM, баланс скорости
EXL2 (4.5 bpw)4.5-bit~40 ГБ~44 ГБМаксимальный FPS на GPU
GPTQ4-bit~39 ГБ~43 ГБШирокая совместимость

Почему Llama 3 70B — это «золотая середина»?

Модель на 70 миллиардов параметров от Meta (признана экстремистской в РФ) — это тот самый компромисс, где модель уже обладает логикой и знаниями на уровне GPT-4, но еще не требует покупки суперкомпьютера за сотни тысяч долларов, как это происходит с моделями на 400+ миллиардов параметров.

Проблема лишь в том, что "чистая" версия в FP16 занимает около 140 ГБ видеопамяти. С учетом KV-кэша на минимальный контекст вам потребуется кластер из двух NVIDIA A100 (по 80GB каждая). Аренда такого кластера может превышать 150-200 тысяч рублей в месяц. На помощь приходит квантование.

GGUF: спасение для тех, у кого нет 48 ГБ видеопамяти

Формат GGUF, используемый в движке llama.cpp, уникален тем, что позволяет **частично** переложить нагрузку на оперативную память (RAM) вашего сервера.

Если вы арендуете сервер с одной карточкой RTX 4090 (24GB VRAM) и 64 ГБ RAM, вы сможете загрузить около 35 слоев модели в быструю память видеокарты, а остальные 45 слоев оставить в медленной оперативной памяти. Модель запустится, будет работать исправно, но скорость составит 5–8 токенов в секунду. Это отличный вариант для тестирования или фоновых задач (парсинга, суммаризации).

AWQ: индустриальный стандарт для production

Activation-aware Weight Quantization (AWQ) — это современный алгоритм сжатия, который анализирует, какие веса (нейроны) модели наиболее важны, и сохраняет их точность, ужимая только "второстепенные".

В формате AWQ Llama 3 70B весит около 38 ГБ. Это значит, что она идеально помещается в 48 ГБ видеопамяти (оставляя 10 ГБ под контекст). Вы можете использовать популярный и быстрый движок **vLLM**, арендовать сервер с 1x NVIDIA L40S 48GB или двумя RTX 4090, и получить потрясающую скорость в 25–40 токенов в секунду. AWQ сегодня — это выбор №1 для боевых API.

EXL2 (ExLlamaV2): для фанатов максимальной скорости

EXL2 — это формат, созданный специально для движка ExLlamaV2. Его главная фишка — поддержка дробного квантования (например, 4.0, 4.5 или 5.0 бит на вес).

Если вам нужно выжать максимум токенов в секунду из ваших двух видеокарт RTX 4090, то связка ExLlamaV2 + EXL2 4.5 bpw выдаст лучшие результаты по скорости генерации при качестве ответов, визуально неотличимом от оригинала. Минус формата — он поддерживается меньшим числом интерфейсов по сравнению с vLLM.

Итог: какое железо брать?

• **Дешево и сердито:** Сервер с 1x RTX 4090 (24GB) + 64 GB RAM. Используем GGUF (Q4). Цена от ~28 000 руб/мес. Скорость ~6 т/с.

• **Оптимально (баланс):** Сервер с 2x RTX 4090 (48GB) или 1x L40S. Используем AWQ или EXL2. Цена от ~50 000 руб/мес. Скорость ~30 т/с.

• **Энтерпрайз:** Сервер с 1x A100 (80GB). Используем 8-бит (FP8) или AWQ. Отличная работа с длинным контекстом (RAG) без OOM. Цена от ~130 000 руб/мес.

Рекомендованные конфигурации по теме статьи

Проверенные серверы от надежных провайдеров

Весь каталог
Timeweb Cloud
Перейти
Serverspace
Перейти
Хит цены
Timeweb Cloud

Timeweb Cloud

Москва4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Serverspace

Serverspace

Москва4.7

vStack Start

CPU

1 ядер • 3 ГГц

RAM

1 ГБ

Диск

25 ГБ NVMe

Канал

200 Мбит/с

399 ₽/мес

Timeweb Cloud

Timeweb Cloud

Москва4.8

Cloud Basic

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

40 ГБ NVMe

Канал

200 Мбит/с

499 ₽/мес

Часто задаваемые вопросы (FAQ)

Смогу ли я запустить Llama 3 70B на Mac Studio?

Да. На Apple Silicon (M2/M3 Ultra) архитектура разделяемой памяти (Unified Memory) позволяет GPU обращаться напрямую ко всей ОЗУ. Mac с 128 ГБ объединенной памяти запустит модель в GGUF-формате намного быстрее, чем обычный x86 сервер при оффлоадинге, выдавая около 12–15 токенов в секунду.

Что будет, если контекст превысит размер VRAM?

Вы получите ошибку CUDA Out of Memory (OOM) и процесс упадет. Движок vLLM позволяет заранее выделить фиксированный блок памяти под KV-кэш (ключ --gpu-memory-utilization 0.9), что предотвратит падение, но по достижении лимита модель просто перестанет принимать новые токены.