Сколько VRAM нужно для запуска Llama 3 70B: полный гайд по квантованию (GGUF, AWQ, EXL2) и выбору GPU
Исчерпывающее руководство по подбору видеокарт для одной из самых популярных открытых нейросетей Llama 3 70B. Разбираем разницу между форматами квантования GGUF, AWQ и EXL2, влияние на качество и точные требования к VRAM.
Для комфортного запуска Llama 3 70B в 4-битном квантовании (AWQ или EXL2) с небольшим контекстом потребуется минимум 40-42 ГБ VRAM. Идеальным железом для этой задачи станут 2x NVIDIA RTX 4090 (24GB) или 1x NVIDIA L40S (48GB). Формат GGUF (4-bit) позволяет перенести часть вычислений на оперативную память сервера (RAM), но скорость генерации значительно упадет.
- Оригинальная Llama 3 70B в FP16 требует более 140 ГБ видеопамяти. Без квантования её запуск обходится слишком дорого.
- Формат GGUF (для llama.cpp) отлично подходит для смешанного (CPU+GPU) инференса, когда не хватает VRAM.
- Формат AWQ (vLLM) — стандарт для серверов. 4-битный AWQ снижает вес 70B до ~38 ГБ без заметной потери качества.
- Формат EXL2 (ExLlamaV2) — лучший выбор для максимальной скорости (т/с) на одном или нескольких GPU, поддерживает дробное квантование (например, 4.5 bpw).
Сравнение форматов квантования для Llama 3 70B
| Формат | Битрейт | Вес файла | Требуемый VRAM (с кэшем) | Плюсы |
|---|---|---|---|---|
| Без сжатия (FP16) | 16-bit | ~140 ГБ | ~155 ГБ | Идеальное качество |
| GGUF (Q4_K_M) | 4-bit | ~41 ГБ | От 8 ГБ (остальное в RAM) | Оффлоадинг на процессор |
| AWQ | 4-bit | ~38 ГБ | ~42 ГБ | Стандарт vLLM, баланс скорости |
| EXL2 (4.5 bpw) | 4.5-bit | ~40 ГБ | ~44 ГБ | Максимальный FPS на GPU |
| GPTQ | 4-bit | ~39 ГБ | ~43 ГБ | Широкая совместимость |
Почему Llama 3 70B — это «золотая середина»?
Модель на 70 миллиардов параметров от Meta (признана экстремистской в РФ) — это тот самый компромисс, где модель уже обладает логикой и знаниями на уровне GPT-4, но еще не требует покупки суперкомпьютера за сотни тысяч долларов, как это происходит с моделями на 400+ миллиардов параметров.
Проблема лишь в том, что "чистая" версия в FP16 занимает около 140 ГБ видеопамяти. С учетом KV-кэша на минимальный контекст вам потребуется кластер из двух NVIDIA A100 (по 80GB каждая). Аренда такого кластера может превышать 150-200 тысяч рублей в месяц. На помощь приходит квантование.
GGUF: спасение для тех, у кого нет 48 ГБ видеопамяти
Формат GGUF, используемый в движке llama.cpp, уникален тем, что позволяет **частично** переложить нагрузку на оперативную память (RAM) вашего сервера.
Если вы арендуете сервер с одной карточкой RTX 4090 (24GB VRAM) и 64 ГБ RAM, вы сможете загрузить около 35 слоев модели в быструю память видеокарты, а остальные 45 слоев оставить в медленной оперативной памяти. Модель запустится, будет работать исправно, но скорость составит 5–8 токенов в секунду. Это отличный вариант для тестирования или фоновых задач (парсинга, суммаризации).
AWQ: индустриальный стандарт для production
Activation-aware Weight Quantization (AWQ) — это современный алгоритм сжатия, который анализирует, какие веса (нейроны) модели наиболее важны, и сохраняет их точность, ужимая только "второстепенные".
В формате AWQ Llama 3 70B весит около 38 ГБ. Это значит, что она идеально помещается в 48 ГБ видеопамяти (оставляя 10 ГБ под контекст). Вы можете использовать популярный и быстрый движок **vLLM**, арендовать сервер с 1x NVIDIA L40S 48GB или двумя RTX 4090, и получить потрясающую скорость в 25–40 токенов в секунду. AWQ сегодня — это выбор №1 для боевых API.
EXL2 (ExLlamaV2): для фанатов максимальной скорости
EXL2 — это формат, созданный специально для движка ExLlamaV2. Его главная фишка — поддержка дробного квантования (например, 4.0, 4.5 или 5.0 бит на вес).
Если вам нужно выжать максимум токенов в секунду из ваших двух видеокарт RTX 4090, то связка ExLlamaV2 + EXL2 4.5 bpw выдаст лучшие результаты по скорости генерации при качестве ответов, визуально неотличимом от оригинала. Минус формата — он поддерживается меньшим числом интерфейсов по сравнению с vLLM.
Итог: какое железо брать?
• **Дешево и сердито:** Сервер с 1x RTX 4090 (24GB) + 64 GB RAM. Используем GGUF (Q4). Цена от ~28 000 руб/мес. Скорость ~6 т/с.
• **Оптимально (баланс):** Сервер с 2x RTX 4090 (48GB) или 1x L40S. Используем AWQ или EXL2. Цена от ~50 000 руб/мес. Скорость ~30 т/с.
• **Энтерпрайз:** Сервер с 1x A100 (80GB). Используем 8-бит (FP8) или AWQ. Отличная работа с длинным контекстом (RAG) без OOM. Цена от ~130 000 руб/мес.
Проверенные серверы от надежных провайдеров
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Часто задаваемые вопросы (FAQ)
Смогу ли я запустить Llama 3 70B на Mac Studio?
Да. На Apple Silicon (M2/M3 Ultra) архитектура разделяемой памяти (Unified Memory) позволяет GPU обращаться напрямую ко всей ОЗУ. Mac с 128 ГБ объединенной памяти запустит модель в GGUF-формате намного быстрее, чем обычный x86 сервер при оффлоадинге, выдавая около 12–15 токенов в секунду.
Что будет, если контекст превысит размер VRAM?
Вы получите ошибку CUDA Out of Memory (OOM) и процесс упадет. Движок vLLM позволяет заранее выделить фиксированный блок памяти под KV-кэш (ключ --gpu-memory-utilization 0.9), что предотвратит падение, но по достижении лимита модель просто перестанет принимать новые токены.