Transformers теперь запускает кванты llama.cpp.
Запускать модели искусственного интеллекта на вашем ноутбуке стало намного проще, и llama.cpp сыграл в этом важную роль. Его механизм вывода поддерживает локальные инструменты искусственного интеллекта, такие как Ollama, LM Studio и Jan. Наряду с такими проектами, как MLX, он помог сделать локальный вывод практическим вариантом для повседневного использования. Вот где мы находимся прямо сейчас. И я не буду врать, это выглядит довольно волшебно 🧙♀️ Qwen3.6 27B работает внутри агента кодирования Pi через Llama.cpp на MacBook Pro. Для нетривиальных задач на кодовых базах @huggingface это очень, очень близко к последнему Opus в Claude… pic.twitter.com/lsIxLoUneU GGUF, разработанный командой llama.cpp, представляет собой широко используемый формат для локального вывода. Команда также делится квантованными контрольными точками в ggml-org на Hub. Такие издатели, как Unsloth, LM Studio Community и bartowski, также предоставляют готовые к использованию контрольные точки GGUF в различных вариантах квантования, поэтому пользователи могут выбрать версию, подходящую для их машины. Модели GGUF были загружены миллионы раз. Мы также хотим упростить локальный запуск этих моделей с помощью преобразователей. Совместимость полезна только в том случае, если модель приятна в эксплуатации. Чтобы приблизить производительность к llama.cpp, мы повторно используем лежащие в его основе ядра ggml через библиотеку ядер и сокращаем накладные расходы при генерации . Нашей первоначальной целью является локальный анализ Apple Silicon, начиная с архитектуры Qwen3.5. Что такое формат файла GGUF? GGUF упаковывает веса модели и метаданные, включая информацию о токенизаторе и дополнительный шаблон чата, в один файл. Он поддерживает различные уровни квантования, позволяя вам обменивать некоторую точность на меньший объем памяти. Такие варианты, как Q4_K_M, сочетают точность тензоров, используя в основном 4-битные веса, сохраняя при этом чувствительные тензоры с более высокой точностью. Вот как квантование меняет размер файла Qwen3.5-4B от Unsloth: Мы предлагаем начать с Q4_K_M, а затем попробовать Q5_K_M или Q6_K, если у вас больше доступной памяти. Более агрессивное квантование может помочь более крупным моделям соответствовать, но компромисс в качестве зависит от модели и задачи. Оцените работу, которую вы действительно хотите, чтобы модель выполняла. Документация GGUF Hub описывает доступные типы квантования. Нагрузка ГГУФ трансформаторами Для начала работы необходимо: 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть модель Qwen 3.8-Omni-Flash?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.