Создатели llama.cpp и GGML присоединились к Hugging Face: что это значит для локального ИИ
Слияние ключевых разработчиков llama.cpp с экосистемой Hugging Face гарантирует стабильное развитие главного инструмента для локального инференса LLM и ускорит появление новых архитектур в открытом доступе.
Команда разработчиков во главе с Георгием Гергановым (Georgi Gerganov), создавшим фреймворк GGML и библиотеку для локального инференса llama.cpp, официально перешла в команду Hugging Face. Этот шаг призван обеспечить долгосрочное финансовое и техническое обеспечение проекта, который стал стандартом де-факто для запуска больших языковых моделей на потребительском «железе» и серверах без привязки к облачным API. По заявлению сторон, кодовая база останется на 100% открытой (Open Source), а команда сохранит полную автономию в принятии технических решений. Главным фокусом партнерства станет глубокая интеграция между экосистемой Hugging Face Transformers (как основным источником архитектур моделей) и рантаймом llama.cpp. Разработчики планируют реализовать бесшовный («в один клик») экспорт и деплой новых архитектур, а также улучшить упаковку и дистрибуцию GGML-софта для продакшена и конечных пользователей. - Укрепление локального инференса: Связка Hugging Face (определения моделей) и llama.cpp (выполнение на CPU и GPU) формирует единый ультимативный стек для эффективного запуска ИИ на “железе”. - Улучшение UX и упаковки: Упрощение развертывания моделей в продакшене и на периферийных устройствах на фоне роста популярности локального инференса как альтернативы облачным решениям. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть Llama 3.3?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.