Ко всем новостям
🌐Hugging Face Blog

Представляем AutoRound: расширенное квантование Intel для LLM и VLM

AutoRound — это метод посттренировочного квантования (PTQ), основанный только на весе, разработанный Intel. Он использует знаковый градиентный спуск для совместной оптимизации диапазонов округления веса и ограничения, обеспечивая точное низкобитное квантование (например, INT2 – INT8) с минимальной потерей точности в большинстве сценариев. Например, при INT2 он превосходит популярные базовые показатели по относительной точности почти в 2,1 раза. На изображении ниже представлен обзор основного алгоритма AutoRound. Для получения более подробной информации, пожалуйста, обратитесь к нашей статье. Несмотря на высокую производительность, AutoRound работает быстро и легко: квантование модели 72B занимает всего 37 минут на графическом процессоре A100 в облегченном режиме. Он также поддерживает настройку смешанных битов, квантование головки lm, экспорт форматов GPTQ/AWQ/GGUF и гибкие рецепты настройки. Ключевые преимущества Превосходная точность при малой разрядности AutoRound обеспечивает весьма многообещающие результаты, особенно в сценариях низкоразрядного квантования. Оценки различных задач показывают, что он значительно превосходит популярные методы при 2-битной точности (источник). При 4-битном формате AutoRound в большинстве случаев продолжает сохранять конкурентное преимущество, о чем свидетельствует таблица лидеров Low-Bit Open LLM. 2. Модели широкой совместимости LLM: AutoRound поддерживает практически все популярные архитектуры LLM, включая такие известные модели, как Qwen, LLaMA и DeepSeek. Готовые к использованию квантованные модели доступны на Hugging Face в таких коллекциях, как OPEA, Kaitchup и fbaldassarri. VLM: AutoRound поддерживает более 10 моделей языка видения (VLM), включая Mistral-Small-3.1, Gemma3 и другие. Полный список вы можете найти в README, а готовые к использованию квантованные модели доступны в коллекции OPEA Hugging Face. Для моделей, которые еще не поддерживаются, вы все равно можете применить наш метод RTN с --iters 0 . Никакой настройки не требуется, но ожидается некоторая потеря точности. Устройства ЦП Intel GPU CUDA Конфигурации квантования Int8 Только вес Int4 Только вес Int3 Только вес Int2 Только вес Смешанные биты Только вес Экспортные форматы AutoRound GPTQ AWQ Некоторые GGUF 3. Гибкое/эффективное квантование AutoRound требует всего 200 шагов настройки и небольшого набора калибровочных данных (всего 128 выборок) для достижения высокой точности. Эта эффективность приводит к более быстрому квантованию и уменьшению потребления ресурсов по сравнению с другими методами int2, которые требуют более интенсивных вычислений. Начало работы с AutoRound Установка pip install auto-round Квантование и сериализация В настоящее время для создания квантованных моделей поддерживается только автономный режим. Использование командной строки auto-round \ --model Qwen/Qwen3-0.6B \ --bits 4 \ --group_size 128 \ --format "auto_round,auto_awq,auto_gptq" \ --output_dir ./tmp_autoround AutoRound также предлагает еще два рецепта, auto-round-best и auto-round-light, предназначенные для оптимальной точности и повышенной скорости соответственно. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.

Где захостить и как запустить

Планируете развернуть модель Qwen 3.8-Omni-Flash?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
Хит цены
Aeza

Aeza

Москва★ 4.6

Shared Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

10 ГБ NVMe

Канал

200 Мбит/с

149 ₽/мес

Хит цены
Timeweb Cloud

Timeweb Cloud

Москва★ 4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Aeza

Aeza

Москва★ 4.6

Shared Medium

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

30 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐Data Center DynamicsAI-адаптация

Гиперскейлер против истории: в Шотландии планируют строительство ЦОД мощностью 600 МВт

В Шотландии разгорается конфликт между сохранением исторического наследия и развитием инфраструктуры ИИ. Девелопер планирует возведение гиперскейлерного дата-центра мощностью 600 МВт, что ставит под угрозу существование замка с 1000-летней историей. Застройщик утверждает, что проект будет интегрировать элементы старинной кирпичной кладки в архитектуру кампуса, однако масштаб объекта (600 МВт) указывает на создание колоссального вычислительного узла, способного обслуживать крупнейшие облачные кластеры и задачи обучения LLM. Ключевые аспекты проекта: * **Масштабируемость:** Мощность в 600 МВт выводит объект в категорию крупнейших гиперскейлеров Европы. * **Энергопотребление:** Столь высокие показатели требуют прямой интеграции с магистральными сетями электропередачи и, вероятно, строительства собственных подстанций. * **Конфликт интересов:** Попытки совместить индустриальный дизайн ЦОД с историческим наследием вызывают вопросы к экологической и градостроительной экспертизе. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе современного оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Строительство ЦОД мощностью 600 МВт подчеркивает критический дефицит площадок с доступом к мощной энергетической инфраструктуре для нужд ИИ-индустрии.
🌐Phoronix

Драйвер NVIDIA 615.78.08 для Linux добавляет VK_NV_low_latency2 r3 для улучшенного VKD3D-Proton

NVIDIA сегодня выпустила сборку драйвера для Linux 615.78.08 с полезным улучшением для геймеров, использующих Steam Play (Proton) с играми Direct3D 12 через VKD3D-Proton, а также множеством других исправлений... ⚙️ **Выбор хостинга:** быстро подобрать надёжный VPS или выделенный сервер с защитой от DDoS, нужной геолокацией и соответствием 152-ФЗ можно с помощью [мастера подбора на ServerSales](/wizard).

#Инфраструктура
Дайджест ServerSalesЧитать на источнике
🌐PhoronixAI-адаптация

Google тестирует изоляцию драйверов Linux через LFI-песочницы: новый уровень безопасности ядра

Инженеры Google представили проект Kage — экспериментальный подход к изоляции драйверов устройств в ядре Linux. Вместо классического монолитного подхода, где драйвер имеет полный доступ к памяти ядра, используется технология Lightweight Fault Isolation (LFI) на базе LLVM. Это позволяет компилировать драйверы с жесткими ограничениями доступа к памяти, предотвращая критические сбои системы при ошибках в коде драйвера. Ключевые технические аспекты: * Использование LLVM LFI для статического анализа и вставки проверок доступа на этапе компиляции. * Минимизация оверхеда: в отличие от виртуализации или запуска драйверов в userspace (как в FUSE), LFI работает непосредственно в адресном пространстве ядра с минимальными задержками. * Повышение отказоустойчивости: изоляция критических узлов драйверов снижает риск Kernel Panic при некорректной работе периферии. 🔍 Как выбрать сервер: Если вы планируете развертывание высоконагруженных систем, где критична стабильность ядра и работа с кастомным оборудованием, сравнить актуальные конфигурации серверов и подобрать надежное железо можно в каталоге ServerSales (/catalog).

💡 Инсайт:Технология LFI обещает радикально повысить стабильность Linux-серверов, превращая драйверы из потенциальных точек отказа в изолированные модули без существенных потерь производительности.
#Серверы#Безопасность
Дайджест ServerSalesЧитать на источнике