Сжатие LLM через физику спиновых стекол: как удаление блоков на основе задачи Изинга обходит конкурентов на 23% в MMLU
Применение инструментов статистической физики к оптимизации LLM позволяет агрессивно сжимать тяжелые модели (вроде Llama-3.3-70B) с минимальными потерями в качестве, экономя ресурсы дорогостоящего инференса.
Исследователи предложили принципиально новый подход к глубокой компрессии языковых моделей, переведя задачу выбора удаляемых трансформерных блоков в плоскость статистической физики. Вместо независимой оценки каждого слоя (mean-field подход), метод рассматривает взаимодействие блоков как систему с все-ко-всеми связями, моделируя ее через матрицу Гессе как задачу условной бинарной оптимизации (CBO) в виде спинового стекла Изинга. Главные технологические особенности метода: - Учет межуровневых связей: Диагональ матрицы Гессе отвечает за важность отдельного блока, а недиагональные элементы — за парные взаимодействия (coupling), что позволяет корректно удалять до половины слоев модели без каскадного падения качества. - Отказ от дорогого бенчмаркинга: Энергия спиновой системы выступает дешевым и точным прокси-показателем будущей производительности. Расчет матрицы Гессе делается один раз на калибровочном датасете, после чего перебор миллиардов конфигураций заменяется быстрым вычислением энергии. - Впечатляющий прирост: На модели Llama-3.3-70B-Instruct при 50% сжатии новый метод выигрывает почти 23 процентных пункта на бенчмарке MMLU по сравнению с лучшими классическими аналогами. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть Llama 3.3?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.