Релиз Gemma 3n: мультимодальные модели с эффективным использованием VRAM и архитектурой MatFormer
Gemma 3n меняет правила игры для edge-инференса, позволяя запускать мультимодальные модели высокого качества на минимальном железе за счет умной архитектуры слоев.
Google представила Gemma 3n — новую линейку мультимодальных моделей (текст, аудио, видео), которые используют архитектуру MatFormer для динамического масштабирования. Ключевая особенность — концепция «Effective Parameters» (E2B и E4B), позволяющая моделям с реальным весом 5B и 8B потреблять ресурсы на уровне 2B и 4B соответственно. ### Технические особенности и требования: * Эффективность VRAM: Модель E2B требует всего 2 ГБ VRAM, модель E4B — 3 ГБ VRAM. Это делает их идеальными для запуска на потребительских GPU и edge-устройствах. * Архитектура MatFormer: Позволяет извлекать подмножества слоев, адаптируя модель под конкретный бюджет памяти без потери качества. * Per-Layer Embeddings (PLE): Выгрузка эмбеддингов на CPU существенно снижает нагрузку на видеопамять. * KV Cache Sharing: Ускоряет префилл (prefill) в 2 раза по сравнению с Gemma 3 4B, что критично для обработки длинных контекстов в мультимодальных задачах. * Поддержка: Модели уже доступны в `transformers`, `timm`, `llama.cpp`, `ollama` и `MLX`. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть Llama 3.3?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.