Ко всем новостям
🌐Hugging Face BlogAI-адаптировано

Google Cloud C4 на Intel Xeon 6: прирост TCO на 70% при инференсе MoE-моделей на CPU

Инсайт ServerSales • Влияние на рынок

Процессоры Intel Xeon 6 в связке с оптимизациями Hugging Face делают CPU-инференс крупных MoE-моделей экономически эффективной альтернативой GPU-кластерам.

Google Cloud представил новые инстансы C4 на базе процессоров Intel Xeon 6 (Granite Rapids), демонстрирующие снижение совокупной стоимости владения (TCO) на 70% по сравнению с предыдущим поколением C3 при запуске открытых экспертных (MoE) моделей в связке с Hugging Face. Ключевым драйвером производительности стала коллаборация Intel и Hugging Face: в библиотеку `transformers` добавлена оптимизация выполнения экспертов (PR #40304). Она устраняет избыточные вычисления, направляя каждый под-модуль (эксперт) только на те токены, к которым он маршрутизируется шлюзовой сетью. Это полностью убирает лишние FLOPs и максимизирует утилизацию ядер CPU без необходимости задействовать дорогостоящие GPU для инференса определенных классов моделей. * Аппаратная база: Инстансы GCP C4 на Intel Xeon 6 против C3 на 4-м поколении Intel Xeon (Sapphire Rapids). * Тестовая модель: `unsloth/gpt-oss-120b-BF16` в формате bfloat16 (MoE). * Метрики: Стабильное декодирование, статический KV-кэш и бэкенд SDPA обеспечили кратный прирост пропускной способности (токен/сек) при масштабировании батчей. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

Где захостить и как запустить

Планируете развернуть эту нейросеть?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 3090 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 3090 (24 ГБ GDDR6X)

39 ₽/час

24 999 ₽/мес

В наличииGPU
Timeweb Cloud

Timeweb Cloud

Россия★ 4.8

GPU RTX A5000 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX A5000 (24 ГБ GDDR6X)

36 ₽/час

24 999 ₽/мес

В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 4090 24GB

CPU

16 ядер

RAM

128 ГБ

Диск

1000 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 4090 (24 ГБ GDDR6X)

47 ₽/час

32 999 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐Data Center DynamicsAI-адаптация

Интеграция чипов Cerebras в облако General Compute: ставка на беспрецедентный прирост скорости ИИ-инференса

Компания General Compute заключила многолетнее соглашение с Cerebras Systems, в рамках которого уникальные процессоры вафельного масштаба (Wafer-Scale Engine, WSE) будут развернуты в облачной инфраструктуре провайдера. Это партнерство нацелено на резкое ускорение рабочих нагрузок генеративного искусственного интеллекта и масштабного инференса крупных языковых моделей (LLM). Ключевые особенности и технические преимущества интеграции: - **Производительность чипов Cerebras:** Архитектура WSE объединяет вычислительные ядра и огромный объем кристальной памяти SRAM на одной кремниевой пластине, обеспечивая колоссальную пропускную способность памяти и скорость генерации токенов, недостижимую для стандартных кластеров на базе GPU. - **Снижение латентности:** Новая облачная платформа позволит разработчикам запускать ресурсоемкие ML-модели с минимальной задержкой, оптимизируя затраты на инфраструктуру при высоких нагрузках в продакшене. - **Масштабируемость:** Инфраструктура General Compute предоставит гибкий доступ к мощностям вафельного уровня без необходимости развертывать собственные стойки с экзотическим железом. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Появление систем вафельного масштаба Cerebras в публичных облаках дает инженерам мощную альтернативу GPU-кластерам для задач экстремального ИИ-инференса с ультранизкой задержкой.
🌐Data Center DynamicsAI-адаптация

Инвестиции в ЦОД: Польский национальный центр обработки данных получил грант в $401 млн

Польский национальный центр обработки данных привлек масштабное финансирование в размере 1,56 млрд злотых (около $401 млн) в рамках программы Европейского фонда цифрового развития (EFDD). Эти инвестиции направлены на модернизацию и расширение критической ИТ-инфраструктуры, что позволит существенно нарастить вычислительные мощности для научных исследований, государственных сервисов и высокопроизводительных вычислений (HPC). Полученные средства пойдут на следующие цели: * Закупку нового серверного оборудования, современных вычислительных узлов и высокопроизводительных систем хранения данных (СХД). * Повышение энергоэффективности дата-центров и внедрение передовых систем охлаждения для снижения показателей PUE. * Развитие сетевой инфраструктуры с высокой пропускной способностью для интеграции с общеевропейскими научными и облачными сетями. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Крупные инвестиции ЕС в государственные ЦОД стимулируют спрос на передовое серверное железо и энергоэффективные инженерные системы.
🌐Data Center DynamicsAI-адаптация

NetworkOcean запускает плавучий дата-центр на солнечных батареях в заливе Сан-Франциско

Стартап NetworkOcean объявил о стратегическом пивоте: компания отказалась от концепции подводных дата-центров в пользу плавучих серверных ферм, полностью обеспечиваемых солнечной энергией. Новый объект развернут непосредственно в акватории залива Сан-Франциско и нацелен на решение ключевых проблем современной инфраструктуры ИИ — дефицита энергомощностей в традиционных ЦОД и дороговизны систем охлаждения. Основные технологические особенности плавучего дата-центра: * Питание исключительно за счет возобновляемой солнечной генерации, что позволяет снизить углеродный след тяжелых вычислений. * Использование природной воды для систем охлаждения, минимизирующее затраты на кондиционирование воздуха. * Подвижная архитектура, позволяющая масштабировать вычислительные мощности ближе к источникам генерации энергии. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Плавающие дата-центры на солнечной энергии открывают новый путь обхода энергетического кризиса в традиционных локациях ЦОД.
#ЦОД#Серверы#Охлаждение#Облако