Представляем AutoRound: расширенное квантование Intel для LLM и VLM
AutoRound — это метод посттренировочного квантования (PTQ), основанный только на весе, разработанный Intel. Он использует знаковый градиентный спуск для совместной оптимизации диапазонов округления веса и ограничения, обеспечивая точное низкобитное квантование (например, INT2 – INT8) с минимальной потерей точности в большинстве сценариев. Например, при INT2 он превосходит популярные базовые показатели по относительной точности почти в 2,1 раза. На изображении ниже представлен обзор основного алгоритма AutoRound. Для получения более подробной информации, пожалуйста, обратитесь к нашей статье. Несмотря на высокую производительность, AutoRound работает быстро и легко: квантование модели 72B занимает всего 37 минут на графическом процессоре A100 в облегченном режиме. Он также поддерживает настройку смешанных битов, квантование головки lm, экспорт форматов GPTQ/AWQ/GGUF и гибкие рецепты настройки. Ключевые преимущества Превосходная точность при малой разрядности AutoRound обеспечивает весьма многообещающие результаты, особенно в сценариях низкоразрядного квантования. Оценки различных задач показывают, что он значительно превосходит популярные методы при 2-битной точности (источник). При 4-битном формате AutoRound в большинстве случаев продолжает сохранять конкурентное преимущество, о чем свидетельствует таблица лидеров Low-Bit Open LLM. 2. Модели широкой совместимости LLM: AutoRound поддерживает практически все популярные архитектуры LLM, включая такие известные модели, как Qwen, LLaMA и DeepSeek. Готовые к использованию квантованные модели доступны на Hugging Face в таких коллекциях, как OPEA, Kaitchup и fbaldassarri. VLM: AutoRound поддерживает более 10 моделей языка видения (VLM), включая Mistral-Small-3.1, Gemma3 и другие. Полный список вы можете найти в README, а готовые к использованию квантованные модели доступны в коллекции OPEA Hugging Face. Для моделей, которые еще не поддерживаются, вы все равно можете применить наш метод RTN с --iters 0 . Никакой настройки не требуется, но ожидается некоторая потеря точности. Устройства ЦП Intel GPU CUDA Конфигурации квантования Int8 Только вес Int4 Только вес Int3 Только вес Int2 Только вес Смешанные биты Только вес Экспортные форматы AutoRound GPTQ AWQ Некоторые GGUF 3. Гибкое/эффективное квантование AutoRound требует всего 200 шагов настройки и небольшого набора калибровочных данных (всего 128 выборок) для достижения высокой точности. Эта эффективность приводит к более быстрому квантованию и уменьшению потребления ресурсов по сравнению с другими методами int2, которые требуют более интенсивных вычислений. Начало работы с AutoRound Установка pip install auto-round Квантование и сериализация В настоящее время для создания квантованных моделей поддерживается только автономный режим. Использование командной строки auto-round \ --model Qwen/Qwen3-0.6B \ --bits 4 \ --group_size 128 \ --format "auto_round,auto_awq,auto_gptq" \ --output_dir ./tmp_autoround AutoRound также предлагает еще два рецепта, auto-round-best и auto-round-light, предназначенные для оптимальной точности и повышенной скорости соответственно. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть модель Qwen 3.8-Omni-Flash?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.