Менеджмент моделей в llama.cpp: мультипроцессность, автозагрузка и LRU-вытеснение
Мультипроцессная архитектура и автозагрузка моделей в llama.cpp упрощают локальный деплой и повышают отказоустойчивость инференса в продакшене.
Разработчики `llama.cpp` добавили долгожданную функцию управления моделями в стиле Ollama для своего встроенного HTTP-сервера. Главное обновление — переход на мультипроцессную архитектуру, где каждая инстанс-модель крутится в отдельном процессе. Если какая-то из них упадет от перегрузки или нехватки памяти, остальные останутся работать в штатном режиме. Теперь сервер поддерживает автоматическое сканирование локального кэша или директорий с GGUF-файлами, ленивую загрузку (on-demand) по первому запросу от клиента через OpenAI-совместимый API, а также умное вытеснение по алгоритму LRU (Least-Recently-Used) при достижении лимита одновременно запущенных моделей (по умолчанию — до 4 штук). Инженеры могут вручную управлять жизненным циклом весов через эндпоинты `/models/load` и `/models/unload` для эффективного высвобождения VRAM. * Автообнаружение: Сканирование путей `LLAMA_CACHE` или кастомных папок `--models-dir`. * Отказоустойчивость: Изоляция процессов для каждой LLM защищает весь сервер от падений. * Гибкий контроль VRAM: Автоматическая выгрузка неиспользуемых весов и ручное управление через REST API. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть Llama 3.3?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.