Гранит 4.2 LLM: как они устроены
TL;DR: Granite 4.2 — это наше первое семейство LLM с плотным рассуждением, предназначенное только для декодирования, выпущенное в трех размерах: 3B, 8B и 30B. Эти модели проходят постобучение на основе базовых моделей Granite-4.1. Базовые модели Granite-4.1 были предварительно обучены с нуля примерно на 15Т токенах с помощью пятифазной стратегии, которая расширяет контекстное окно до 512000 токенов, контролировались и настраивались на основе данных о цепочке мыслей, рассуждениях и агентных траекториях, а затем подвергались постобучению с помощью многоэтапного конвейера обучения с подкреплением. Этот конвейер включает в себя агентное RL, где модели 8B и 30B учатся работать с инструментами в реальных изолированных средах. Каждая модель имеет переключатель «думать/не думать», режим мышления с минимальными усилиями, который тратит небольшой бюджет на рассуждения на простые вопросы, а также встроенный вызов инструментов. Все модели Granite 4.2 выпускаются под лицензией Apache 2.0. Обзор Granite 4.2 — это ориентированная на рассуждения версия семейства языковых моделей Granite. Более ранние версии Granite были сильными помощниками в следовании инструкциям; Гранит 4.2 добавляет явные аргументы. Каждая модель может генерировать цепочку мыслей перед ответом и может работать в режиме мышления или без мышления в зависимости от того, сколько обдумывания требует задача. Между этими двумя режимами находится режим с низкими усилиями, при котором на простые вопросы тратится небольшой бюджет на рассуждения. Три размера (3B, 8B и 30B) имеют один и тот же архитектурный дизайн и следуют одному и тому же конвейеру обучения (базовая модель, SFT, затем многоэтапное RL), каждый в своем собственном масштабе. Все трое — сильные мыслители и последователи наставлений. Наиболее четкое разделение способностей проявляется после обучения. Модели 8B и 30B дополнительно проходят агентный блок RL, который учит их действовать как агенты: вызывать инструменты, редактировать и запускать код, управлять терминалом и осуществлять поиск в сети в реальных средах. Каждая модель поддерживает вызов собственных инструментов. Обслуживаемый через конечную точку, совместимую с OpenAI (например, с помощью vLLM), он генерирует вызовы инструментов в формате вызова функций OpenAI и подключается к агентным связям без дополнительных усилий. Granite 4.2 также поддерживается в SGLang, готовый рецепт см. в кулинарной книге SGLang. Оставшаяся часть статьи посвящена сборке: архитектуре, предварительному обучению, контролируемой тонкой настройке, многоэтапному конвейеру RL и результатам. Архитектура модели Модели Granite 4.2 построены на архитектуре плотного трансформатора только с декодером и следующими основными компонентами: Предварительное обучение Модели Granite 4.2 проходят постобучение на основе базовых моделей Granite-4.1. Базовые модели Granite-4.1 были обучены с нуля примерно на 15 триллионах токенов с использованием пятиэтапной стратегии обучения. Фазы 1–2 сосредоточены на базовом предварительном обучении, этапы 3–4 выполняют промежуточное обучение с постепенно более качественным отжигом данных, а этап 5 представляет обучение с длинным контекстом, расширяя контекстное окно до 512 000 токенов. На каждом этапе используется отдельная смесь данных и график скорости обучения, постепенно переходя от широкомасштабных данных в Интернете к более тщательно подобранным и высококачественным источникам. Рецепт предварительной тренировки во многом повторяет рецепт предыдущего поколения; Подробную информацию о смешивании данных, графике этапов и расширении длинного контекста см. в блоге Granite 4.1. SFT: подготовка данных и контроль качества. Контролируемая точная настройка (SFT) превращает базовую модель в надежного помощника по следованию инструкциям, рассуждениям и использованию инструментов. Смесь данных SFT объединяет агентские (31,6%) и неагентские (68,4%) данные, в общей сложности около 7,2 миллиона выборок, или примерно 100 миллиардов токенов, из которых около 65 миллиардов являются обучаемыми. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.