Гайд по LLM• Технологии & Сети

Локальный запуск Llama 3.3 70B на своём сервере: пошаговая инструкция с Ollama и vLLM

Поднимаем Llama 3.3 70B на арендованном GPU-сервере за 20 минут. Два пути: Ollama для быстрого старта и vLLM для высоконагруженного API.

Обновлено: 2026-09-25T06:00:02.799Z
Время чтения: ~12 мин
Автор: Артём Савельев (DevOps-инженер, специалист по ML-инфраструктуре)
Быстрый ответ & Краткая суть

Для запуска Llama 3.3 70B Instruct на своём сервере нужен GPU с минимум 42 ГБ VRAM (Q4 квантование) — подойдут 2×RTX 4090 или 1×A100 80GB. Самый быстрый путь — Ollama (одна команда ollama run llama3.3:70b). Для production API используйте vLLM с поддержкой батчинга и OpenAI-совместимым эндпоинтом.

VRAM (Q4_K_M)~42 ГБ → 2×RTX 4090 или 1×A100
VRAM (FP16)~140 ГБ → 2×A100 80GB или 2×H100
Ollamaollama run llama3.3:70b
Скорость22–48 т/с в зависимости от GPU
Ключевые выводы и краткая суть
  • Llama 3.3 70B Instruct в Q4_K_M занимает ~42 ГБ VRAM — помещается на 2×RTX 4090 или 1×A100 80GB.
  • Ollama — запуск в одну команду, идеален для прототипирования. vLLM — OpenAI-совместимый API с batching, для продакшена.
  • На 2×RTX 4090 модель генерирует 22–32 токена/сек, на A100 80GB — 35–48 т/с.
  • Docker-контейнер с vLLM и предзагруженными весами разворачивается за 10 минут.

Что нужно из железа: минимум и рекомендации

Llama 3.3 70B Instruct — одна из лучших открытых моделей для задач инструкций и чата. 70 миллиардов параметров, контекст 128K токенов, лицензия Llama 3.3 Community (можно в коммерции до 700М MAU). Но 70B — это серьёзная нагрузка на железо.

В формате FP16 (без квантования) веса модели занимают ~140 ГБ. Добавьте сверху KV-кэш на длинный контекст и буферы CUDA — получите 160–170 ГБ. Это 2×A100 80GB или 3×RTX 4090 (которые физически не влезут из-за PCIe ограничений).

В реальности почти все запускают 70B-модели в Q4_K_M или AWQ квантовании: вес файла ~42 ГБ, итого ~50 ГБ с накладными. Две RTX 4090 (48 ГБ суммарно) — это впритык, но работает. Одна A100 80GB — комфортно с запасом на длинные контексты.

RAM тоже важнаДля загрузки весов модели с диска в VRAM через Ollama нужно минимум 64 ГБ системной RAM. Рекомендуется 128 ГБ — это позволит держать несколько моделей в очереди и не упираться в swap.

Путь 1: Ollama — запуск за одну команду

Ollama — самый простой способ поднять LLM на сервере. Установка занимает 30 секунд, запуск модели — одна команда. Внутри — llama.cpp с автоматическим подбором квантования под ваш GPU.

ollama-setup.sh
# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Запуск Llama 3.3 70B (автоматически скачает ~42 ГБ весов)
ollama run llama3.3:70b

# Или как API-сервер (для интеграций)
ollama serve &
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.3:70b",
  "prompt": "Объясни разницу между NVMe и SATA SSD в трёх предложениях",
  "stream": false
}'

Путь 2: vLLM — продакшен-API с батчингом

Если нужен OpenAI-совместимый API с поддержкой concurrent requests и continuous batching — ставьте vLLM. Это Python-фреймворк для высокопроизводительного инференса с PagedAttention (эффективное управление KV-кэшем).

vllm-docker.sh
# Docker-запуск vLLM с Llama 3.3 70B (AWQ квант)
docker run -d --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 8000:8000 \
  --name vllm-llama \
  vllm/vllm-openai:latest \
  --model meta-llama/Llama-3.3-70B-Instruct-AWQ \
  --quantization awq \
  --tensor-parallel-size 2 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.92

# Проверка через OpenAI-совместимый API
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
  "model": "meta-llama/Llama-3.3-70B-Instruct-AWQ",
  "messages": [{"role": "user", "content": "Привет! Расскажи про себя"}],
  "max_tokens": 256
}'
tensor-parallel-size = количество GPUПараметр --tensor-parallel-size должен равняться числу GPU на сервере. Для 2×RTX 4090 ставьте 2, для 4×A100 — 4. vLLM автоматически распределит слои модели по картам.

Замеры производительности: что ждать от разных конфигураций

Тестировали на реальных задачах: генерация ответа на 512 токенов, контекст 2048 токенов, batch=1 (один пользователь).

2×RTX 4090 (Q4_K_M, Ollama): Time to First Token — 1.8 сек, генерация — 22–28 т/с. Для чатбота или внутреннего помощника — более чем достаточно.

1×A100 80GB (AWQ, vLLM): TTFT — 0.9 сек, генерация — 35–42 т/с. При batch=8 пропускная способность вырастает до 180 т/с суммарно.

2×H100 (FP8, vLLM): TTFT — 0.5 сек, генерация — 45–60 т/с. Можно одновременно обслуживать 20–30 пользователей без деградации.

Типичные ошибки при первом запуске

CUDA Out of Memory при загрузке: убедитесь, что на GPU нет других процессов (nvidia-smi). Для vLLM снизьте --gpu-memory-utilization до 0.85.

Медленная загрузка весов: первый запуск в Ollama качает ~42 ГБ из HuggingFace Hub. Если канал сервера узкий, скачайте заранее через huggingface-cli download.

Троттлинг RTX 4090: в дешёвых серверах без продуманного охлаждения карты перегреваются и сбрасывают частоты. Мониторьте температуру через nvidia-smi dmon — должна быть ниже 83°C.

Не та модель: Llama 3.3 70B и Llama 3.1 70B — разные модели. Llama 3.3 значительно лучше по качеству инструкций. В Ollama она называется llama3.3:70b, а не llama3:70b.

Рекомендованные конфигурации по теме статьи

Проверенные серверы от надежных провайдеров

Весь каталог
Хит цены
Aeza

Aeza

Москва★ 4.6

Shared Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

10 ГБ NVMe

Канал

200 Мбит/с

149 ₽/мес

Хит цены
Timeweb Cloud

Timeweb Cloud

Москва★ 4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Aeza

Aeza

Москва★ 4.6

Shared Medium

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

30 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Часто задаваемые вопросы (FAQ)

Можно ли запустить Llama 3.3 70B на CPU без GPU?

Технически — да, через llama.cpp с GGUF-квантованием. Скорость будет 2–5 токенов/сек на 32-ядерном EPYC с 128 ГБ RAM. Для продакшена непригодно, но для тестирования промптов сойдёт.

Ollama или vLLM — что выбрать?

Ollama — для быстрого старта, локальной разработки и одного пользователя. vLLM — для production API с несколькими concurrent пользователями, мониторингом и OpenAI-совместимым интерфейсом.

Сколько стоит запустить Llama 3.3 70B?

Аренда 2×RTX 4090 — от 15 000 ₽/мес, 1×A100 80GB — от 35 000 ₽/мес. При почасовой тарификации — от 60 ₽/час (RTX 4090) до 200 ₽/час (A100). Сравнить цены провайдеров можно в каталоге ServerSales.