Релиз NVIDIA Nemotron Nano 2 9B и мультиязычного датасета: гибридная архитектура Transformer–Mamba для edge-инференса
Гибридная архитектура Mamba-2 в модели Nemotron Nano 2 9B снижает затраты на инференс на 60% и дает 6-кратный прирост скорости токенов для edge- и серверных ИИ-агентов.
NVIDIA выпустила модель Nemotron Nano 2 9B с гибридной архитектурой Transformer–Mamba (комбинация Mamba-2 и компактного набора слоев внимания), а также масштабный мультиязычный датасет reasoning-данных на 6 млн примеров (включая французский, испанский, немецкий, итальянский и японский языки). Главная фишка релиза — настраиваемый бюджет мышления (thinking budget), позволяющий гибко балансировать между точностью и скоростью генерации токенов под конкретные бизнес-задачи. Технические характеристики и требования: * Размер модели: 9 млрд параметров (9B). * Архитектура: Гибридная Transformer–Mamba, обеспечивающая до 6× более высокую пропускную способность токенов по сравнению с классическими трансформерами аналогичного размера. * Оптимизация затрат: Динамический контроль «мыслительных» токенов снижает затраты на инференс до 60%. * Тип лицензии: nvidia-open-model-license. * VRAM и оборудование: Для эффективного деплоя модели на базе NVIDIA NIM или через Hugging Face рекомендуется использовать современные GPU с поддержкой быстрой генерации (оптимально для Edge-устройств, рабочих станций RTX и серверных кластеров). 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.