Локальный запуск Llama 3.3 70B на своём сервере: пошаговая инструкция с Ollama и vLLM
Поднимаем Llama 3.3 70B на арендованном GPU-сервере за 20 минут. Два пути: Ollama для быстрого старта и vLLM для высоконагруженного API.
Для запуска Llama 3.3 70B Instruct на своём сервере нужен GPU с минимум 42 ГБ VRAM (Q4 квантование) — подойдут 2×RTX 4090 или 1×A100 80GB. Самый быстрый путь — Ollama (одна команда ollama run llama3.3:70b). Для production API используйте vLLM с поддержкой батчинга и OpenAI-совместимым эндпоинтом.
- Llama 3.3 70B Instruct в Q4_K_M занимает ~42 ГБ VRAM — помещается на 2×RTX 4090 или 1×A100 80GB.
- Ollama — запуск в одну команду, идеален для прототипирования. vLLM — OpenAI-совместимый API с batching, для продакшена.
- На 2×RTX 4090 модель генерирует 22–32 токена/сек, на A100 80GB — 35–48 т/с.
- Docker-контейнер с vLLM и предзагруженными весами разворачивается за 10 минут.
Что нужно из железа: минимум и рекомендации
Llama 3.3 70B Instruct — одна из лучших открытых моделей для задач инструкций и чата. 70 миллиардов параметров, контекст 128K токенов, лицензия Llama 3.3 Community (можно в коммерции до 700М MAU). Но 70B — это серьёзная нагрузка на железо.
В формате FP16 (без квантования) веса модели занимают ~140 ГБ. Добавьте сверху KV-кэш на длинный контекст и буферы CUDA — получите 160–170 ГБ. Это 2×A100 80GB или 3×RTX 4090 (которые физически не влезут из-за PCIe ограничений).
В реальности почти все запускают 70B-модели в Q4_K_M или AWQ квантовании: вес файла ~42 ГБ, итого ~50 ГБ с накладными. Две RTX 4090 (48 ГБ суммарно) — это впритык, но работает. Одна A100 80GB — комфортно с запасом на длинные контексты.
Путь 1: Ollama — запуск за одну команду
Ollama — самый простой способ поднять LLM на сервере. Установка занимает 30 секунд, запуск модели — одна команда. Внутри — llama.cpp с автоматическим подбором квантования под ваш GPU.
# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Запуск Llama 3.3 70B (автоматически скачает ~42 ГБ весов)
ollama run llama3.3:70b
# Или как API-сервер (для интеграций)
ollama serve &
curl http://localhost:11434/api/generate -d '{
"model": "llama3.3:70b",
"prompt": "Объясни разницу между NVMe и SATA SSD в трёх предложениях",
"stream": false
}'Путь 2: vLLM — продакшен-API с батчингом
Если нужен OpenAI-совместимый API с поддержкой concurrent requests и continuous batching — ставьте vLLM. Это Python-фреймворк для высокопроизводительного инференса с PagedAttention (эффективное управление KV-кэшем).
# Docker-запуск vLLM с Llama 3.3 70B (AWQ квант)
docker run -d --gpus all \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-p 8000:8000 \
--name vllm-llama \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct-AWQ \
--quantization awq \
--tensor-parallel-size 2 \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# Проверка через OpenAI-совместимый API
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "meta-llama/Llama-3.3-70B-Instruct-AWQ",
"messages": [{"role": "user", "content": "Привет! Расскажи про себя"}],
"max_tokens": 256
}'Замеры производительности: что ждать от разных конфигураций
Тестировали на реальных задачах: генерация ответа на 512 токенов, контекст 2048 токенов, batch=1 (один пользователь).
2×RTX 4090 (Q4_K_M, Ollama): Time to First Token — 1.8 сек, генерация — 22–28 т/с. Для чатбота или внутреннего помощника — более чем достаточно.
1×A100 80GB (AWQ, vLLM): TTFT — 0.9 сек, генерация — 35–42 т/с. При batch=8 пропускная способность вырастает до 180 т/с суммарно.
2×H100 (FP8, vLLM): TTFT — 0.5 сек, генерация — 45–60 т/с. Можно одновременно обслуживать 20–30 пользователей без деградации.
Типичные ошибки при первом запуске
CUDA Out of Memory при загрузке: убедитесь, что на GPU нет других процессов (nvidia-smi). Для vLLM снизьте --gpu-memory-utilization до 0.85.
Медленная загрузка весов: первый запуск в Ollama качает ~42 ГБ из HuggingFace Hub. Если канал сервера узкий, скачайте заранее через huggingface-cli download.
Троттлинг RTX 4090: в дешёвых серверах без продуманного охлаждения карты перегреваются и сбрасывают частоты. Мониторьте температуру через nvidia-smi dmon — должна быть ниже 83°C.
Не та модель: Llama 3.3 70B и Llama 3.1 70B — разные модели. Llama 3.3 значительно лучше по качеству инструкций. В Ollama она называется llama3.3:70b, а не llama3:70b.
Проверенные серверы от надежных провайдеров
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Часто задаваемые вопросы (FAQ)
Можно ли запустить Llama 3.3 70B на CPU без GPU?
Технически — да, через llama.cpp с GGUF-квантованием. Скорость будет 2–5 токенов/сек на 32-ядерном EPYC с 128 ГБ RAM. Для продакшена непригодно, но для тестирования промптов сойдёт.
Ollama или vLLM — что выбрать?
Ollama — для быстрого старта, локальной разработки и одного пользователя. vLLM — для production API с несколькими concurrent пользователями, мониторингом и OpenAI-совместимым интерфейсом.
Сколько стоит запустить Llama 3.3 70B?
Аренда 2×RTX 4090 — от 15 000 ₽/мес, 1×A100 80GB — от 35 000 ₽/мес. При почасовой тарификации — от 60 ₽/час (RTX 4090) до 200 ₽/час (A100). Сравнить цены провайдеров можно в каталоге ServerSales.