Ко всем новостям
🌐Hugging Face BlogAI-адаптировано

Менеджмент моделей в llama.cpp: мультипроцессность, автозагрузка и LRU-вытеснение

Инсайт ServerSales • Влияние на рынок

Мультипроцессная архитектура и автозагрузка моделей в llama.cpp упрощают локальный деплой и повышают отказоустойчивость инференса в продакшене.

Разработчики `llama.cpp` добавили долгожданную функцию управления моделями в стиле Ollama для своего встроенного HTTP-сервера. Главное обновление — переход на мультипроцессную архитектуру, где каждая инстанс-модель крутится в отдельном процессе. Если какая-то из них упадет от перегрузки или нехватки памяти, остальные останутся работать в штатном режиме. Теперь сервер поддерживает автоматическое сканирование локального кэша или директорий с GGUF-файлами, ленивую загрузку (on-demand) по первому запросу от клиента через OpenAI-совместимый API, а также умное вытеснение по алгоритму LRU (Least-Recently-Used) при достижении лимита одновременно запущенных моделей (по умолчанию — до 4 штук). Инженеры могут вручную управлять жизненным циклом весов через эндпоинты `/models/load` и `/models/unload` для эффективного высвобождения VRAM. * Автообнаружение: Сканирование путей `LLAMA_CACHE` или кастомных папок `--models-dir`. * Отказоустойчивость: Изоляция процессов для каждой LLM защищает весь сервер от падений. * Гибкий контроль VRAM: Автоматическая выгрузка неиспользуемых весов и ручное управление через REST API. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).

Где захостить и как запустить

Планируете развернуть Llama 3.3?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 3090 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 3090 (24 ГБ GDDR6X)

39 ₽/час

24 999 ₽/мес

В наличииGPU
Timeweb Cloud

Timeweb Cloud

Россия★ 4.8

GPU RTX A5000 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX A5000 (24 ГБ GDDR6X)

36 ₽/час

24 999 ₽/мес

В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 4090 24GB

CPU

16 ядер

RAM

128 ГБ

Диск

1000 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 4090 (24 ГБ GDDR6X)

47 ₽/час

32 999 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐Data Center DynamicsAI-адаптация

Tencent арендует 100 000 GPU через инфраструктуру Oracle: обход санкций или новая схема облачной миграции?

По данным инсайдеров, китайский гигант Tencent заключил масштабное соглашение с Oracle на поставку вычислительных мощностей общим объемом до 100 тысяч графических ускорителей. Главная интрига сделки заключается в том, что облачный провайдер из КНР получает доступ к передовому «железу» NVIDIA, официальные поставки которого на китайский рынок жестко заблокированы экспортными ограничениями США. Подобные партнерства демонстрируют, как крупные игроки находят обходные пути для масштабирования инфраструктуры искусственного интеллекта вне юрисдикции экспортного контроля. Для рынка это означает дальнейшее обострение конкуренции за дефицитные GPU и усложнение цепочек поставок облачных ресурсов. Использование инфраструктуры американского провайдера за пределами материкового Китая позволяет Tencent обучать тяжелые языковые модели и обеспечивать бесперебойный инференс для своих сервисов. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Сделка показывает, как облачные гиганты обходят санкционные ограничения США через аренду инфраструктуры за рубежом, сохраняя доступ к дефицитным GPU.
🌐PhoronixAI-адаптация

AMD RMPOPT: Оптимизация SEV-SNP для ядер Linux 7.4 и серверов EPYC

В грядущем ядре Linux 7.4 появится важная оптимизация для серверных процессоров AMD EPYC, использующих изолированные виртуальные машины с технологией SEV-SNP (Secure Encrypted Virtualization-Secure Nested Paging). Патч направлен на повышение эффективности работы с защищенной памятью и снижение накладных расходов при выполнении критически важных нагрузок в облаках. Технические детали апдейта: - **Улучшение SEV-SNP:** Оптимизация на уровне ядра снижает оверхед при управлении страницами памяти защищенных виртуальных машин. - **Фокус на Enterprise и Cloud:** Нововведение особенно актуально для мультиарендных облачных сред, где каждый процент производительности процессора и пропускной способности памяти имеет критическое значение. - **Интеграция в апстрим:** Патч уже выстроился в очередь на слияние в основную ветку разработки Linux 7.4 вместе с другими графическими и IOMMU-оптимизациями AMD. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе процессоров AMD EPYC и найти оптимальные решения под виртуализацию можно в каталоге ServerSales (/catalog).

💡 Инсайт:Новая оптимизация RMPOPT в Linux 7.4 снижает накладные расходы запущенных в облаках защищенных VM на AMD EPYC SEV-SNP.
#Серверы#AMD_EPYC
Дайджест ServerSalesЧитать на источнике
🌐Data Center DynamicsAI-адаптация

Проект колоссального ЦОД на 9.4 ГВт в Юте: питание от малых модульных реакторов к 2028 году

Стартап Valar Atomics анонсировал амбициозный инфраструктурный проект по строительству дата-центра рекордной мощности в 9.4 гигаватта в штате Юта. Главная особенность кампуса — полная автономность от общей электросети за счет питания от собственных малых модульных реакторов (SMR). Первый ядерный реактор планируется запустить уже в 2028 году, что должно решить острейший дефицит энергомощностей для масштабирования ИИ-кластеров и суперкомпьютеров. Проект отражает глобальный тренд среди технологических гигантов и операторов дата-центров, которые все чаще смотрят в сторону ядерной энергетики для обеспечения бесперебойного питания (24/7) энергоемких AI-нагрузок. Традиционные электросети просто не успевают за темпами ввода в эксплуатацию новых стоек с плотностью энергопотребления от 40 до 100 кВт на стойку. * **Мощность кампуса:** 9.4 ГВт (сопоставимо с крупной атомной электростанцией). * **Источник энергии:** Малые модульные реакторы (SMR) разработки Valar Atomics. * **Сроки реализации:** Запуск первого реактора намечен на 2028 год. * **Назначение:** Размещение массивных кластеров под обучение и инференс тяжелых языковых моделей. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Энергетический кризис в дата-центрах стимулирует переход на автономные SMR-реакторы ради питания сверхплотных ИИ-кластеров.