Hugging Face упростил сборку и обмен кастомными ядрами ROCm для ускорителей AMD
Новый инструмент от Hugging Face стандартизирует и упрощает разработку, тестирование и дистрибуцию кастомных GPU-ядер под ROCm и CUDA без ручной возни со сборочными зависимостями.
Hugging Face представил библиотеку для работы с кастомными ядрами (`kernels`), которая избавляет разработчиков и ML-инженеров от боли ручной сборки через CMake, борьбы с компилятором и проблемами ABI. Проект поддерживает бэкенды CUDA, ROCm, Metal и XPU, обеспечивая бесшовную интеграцию оптимизированных под конкретное железо операций прямо в PyTorch. Особый интерес в обновлении представляет поддержка производительных ядер для графических ускорителей AMD Instinct MI300X. В качестве референса разработчики выделили FP8 block-wise GEMM ядро от команды RadeonFlow (победитель AMD Developer Challenge 2025): * Формат данных: Использование низкоточной арифметики FP8 в спецификации `e4m3fnuz` (4 бита экспоненты, 3 бита мантиссы) для максимального прироста пропускной способности памяти. * Точность вычислений: Применение поблочного масштабирования (`a_scale` и `b_scale`) для нивелирования узкого динамического диапазона FP8 и сохранения точности инференса. * Практическая польза: Ускорение генерации матричных умножений без деградации качества моделей за счет грамотной работы с архитектурными особенностями AMD ROCm. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.