Ко всем новостям
🌐Hugging Face BlogAI-адаптировано

Релиз Gemma 3n: мультимодальные модели с эффективным использованием VRAM и архитектурой MatFormer

Инсайт ServerSales • Влияние на рынок

Gemma 3n меняет правила игры для edge-инференса, позволяя запускать мультимодальные модели высокого качества на минимальном железе за счет умной архитектуры слоев.

Google представила Gemma 3n — новую линейку мультимодальных моделей (текст, аудио, видео), которые используют архитектуру MatFormer для динамического масштабирования. Ключевая особенность — концепция «Effective Parameters» (E2B и E4B), позволяющая моделям с реальным весом 5B и 8B потреблять ресурсы на уровне 2B и 4B соответственно. ### Технические особенности и требования: * Эффективность VRAM: Модель E2B требует всего 2 ГБ VRAM, модель E4B — 3 ГБ VRAM. Это делает их идеальными для запуска на потребительских GPU и edge-устройствах. * Архитектура MatFormer: Позволяет извлекать подмножества слоев, адаптируя модель под конкретный бюджет памяти без потери качества. * Per-Layer Embeddings (PLE): Выгрузка эмбеддингов на CPU существенно снижает нагрузку на видеопамять. * KV Cache Sharing: Ускоряет префилл (prefill) в 2 раза по сравнению с Gemma 3 4B, что критично для обработки длинных контекстов в мультимодальных задачах. * Поддержка: Модели уже доступны в `transformers`, `timm`, `llama.cpp`, `ollama` и `MLX`. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).

Где захостить и как запустить

Планируете развернуть Llama 3.3?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 3090 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 3090 (24 ГБ GDDR6X)

39 ₽/час

24 999 ₽/мес

В наличииGPU
Timeweb Cloud

Timeweb Cloud

Россия★ 4.8

GPU RTX A5000 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX A5000 (24 ГБ GDDR6X)

36 ₽/час

24 999 ₽/мес

В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 4090 24GB

CPU

16 ядер

RAM

128 ГБ

Диск

1000 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 4090 (24 ГБ GDDR6X)

47 ₽/час

32 999 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐Data Center DynamicsAI-адаптация

Quantinuum открывает облачный доступ к квантовому компьютеру Helios для Университета Западной Австралии

Компания Quantinuum объявила о партнерстве с Университетом Западной Австралии (UWA), в рамках которого академическое и исследовательское сообщество вуза получит облачный доступ к передовому квантовому компьютеру Helios. Это сотрудничество направлено на ускорение исследований в области квантовых вычислений, развитие алгоритмов нового поколения и подготовку кадров для высокотехнологичной индустрии. Интеграция квантовых систем в облачную инфраструктуру университетов стирает барьеры для прикладной науки. Теперь исследователи смогут удаленно запускать сложные вычислительные задачи, моделировать молекулярные структуры и тестировать алгоритмы оптимизации без необходимости физического доступа к дорогостоящему и сложному в обслуживании криогенному оборудованию. Основные направления партнерства: * Облачный доступ к аппаратной базе Quantinuum Helios через защищенные каналы связи; * Разработка совместных образовательных и научно-исследовательских программ в сфере квантовых вычислений; * Тестирование гибридных алгоритмов, объединяющих классические HPC-кластеры и квантовые процессоры. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Облачный доступ к квантовым процессорам Quantinuum позволяет академическому сектору тестировать передовые гибридные вычисления без затрат на собственную инфраструктуру.
🌐Data Center DynamicsAI-адаптация

ABB готовит инфраструктуру ЦОД к эре 1 МВт стоек и питания 800 В DC

Компания ABB анонсировала линейку решений для распределения питания, спроектированных с учетом требований высокоплотных вычислений будущего. Основной фокус сделан на поддержке стоек мощностью до 1 МВт и переходе на архитектуры 800 В постоянного тока (800vDC). Это критически важный шаг для питания современных кластеров ИИ, где традиционные системы 400 В становятся узким местом из-за огромных токовых нагрузок и потерь при передаче энергии. Ключевые особенности новых решений: * **Масштабируемость под ИИ-нагрузки:** Оборудование адаптировано для питания сверхплотных GPU-ферм, требующих беспрецедентной плотности мощности на стойку. * **Эффективность 800vDC:** Переход на повышенное напряжение позволяет снизить сечение кабелей и уменьшить потери на преобразование, что напрямую влияет на снижение PUE дата-центра. * **Готовность к инфраструктуре будущего:** Решения закрывают потребность в надежной коммутации и защите цепей в условиях, когда стандартные компоненты уже не справляются с тепловыделением и энергопотреблением новых ускорителей. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Переход на 800 В DC — это неизбежный стандарт для питания стоек с GPU-кластерами нового поколения, позволяющий избежать перегрева инфраструктуры и снизить операционные затраты на электроэнергию.
🌐PhoronixAI-адаптация

WSL теперь поддерживает работу на высоконагруженных серверах с экспериментальными Sparse VHD

Microsoft расширяет возможности WSL (Windows Subsystem for Linux), снимая ограничения на использование подсистемы в Enterprise-сегменте. Ключевым нововведением стала поддержка экспериментальных разреженных виртуальных дисков (Sparse VHD). Это критически важное изменение для системных администраторов, работающих с крупными инстансами: теперь размер VHD-образа будет расти динамически по мере записи данных, а не занимать всё выделенное пространство сразу. Основные преимущества для инфраструктуры: * **Оптимизация дискового пространства:** Снижение оверхеда при развертывании множества контейнеров или сред разработки на одном хосте. * **Масштабируемость:** Возможность запуска WSL на серверах с большим количеством ядер и объемом RAM без жестких ограничений файловой системы, характерных для старых версий. * **Упрощение миграции:** Более гибкая работа с образами в средах виртуализации. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе мощных процессоров AMD EPYC и Intel Xeon, подходящих для виртуализации и работы с тяжелыми нагрузками, можно в каталоге ServerSales (/catalog).

💡 Инсайт:Поддержка Sparse VHD позволяет эффективнее утилизировать дисковое пространство на серверах при запуске WSL, устраняя проблему избыточного резервирования ресурсов.