Релиз SmolLM3-3B: эффективный мультимодельный reasoning-рассуждатель с длинным контекстом
SmolLM3 задает новый стандарт для 3B-моделей: открытый претрейн-рецепт и оптимизации KV-кэша делают её отличным выбором для локального развертывания и инференса на недорогом железе.
Команда разработчиков представила SmolLM3 (3B) — компактную, мультиязычную языковую модель с поддержкой длинного контекста и зачатками рассуждения (reasoning), которая уверенно обходит Llama-3.2-3B и Qwen2.5-3B, конкурируя с более тяжелыми 4-параметрическими решениями. Авторы не только выложили веса, но и поделились полным инженерным рецептом претрейна на базе публичных датасетов. ### Архитектурные особенности и оптимизации: * Grouped-Query Attention (GQA): Переход на 4 группы внимания позволил сохранить производительность Multi-Head Attention, радикально снизив потребление VRAM под KV-кэш при инференсе. * Гибридный NoPE (No Rotary Position Embeddings): Ротационные эмбеддинги удалены из каждого 4-го слоя по методике Yang et al. (2025), что повысило точность на длинных контекстах без деградации коротких промптов. * Intra-Document Masking: Изоляция токенов разных документов в одном батче стабилизировала и ускорило обучение на длинных последовательностях. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть модель Qwen 3.8-Omni-Flash?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.