Ко всем новостям
🌐Hugging Face Blog

Гранит 4.2 LLM: как они устроены

TL;DR: Granite 4.2 — это наше первое семейство LLM с плотным рассуждением, предназначенное только для декодирования, выпущенное в трех размерах: 3B, 8B и 30B. Эти модели проходят постобучение на основе базовых моделей Granite-4.1. Базовые модели Granite-4.1 были предварительно обучены с нуля примерно на 15Т токенах с помощью пятифазной стратегии, которая расширяет контекстное окно до 512000 токенов, контролировались и настраивались на основе данных о цепочке мыслей, рассуждениях и агентных траекториях, а затем подвергались постобучению с помощью многоэтапного конвейера обучения с подкреплением. Этот конвейер включает в себя агентное RL, где модели 8B и 30B учатся работать с инструментами в реальных изолированных средах. Каждая модель имеет переключатель «думать/не думать», режим мышления с минимальными усилиями, который тратит небольшой бюджет на рассуждения на простые вопросы, а также встроенный вызов инструментов. Все модели Granite 4.2 выпускаются под лицензией Apache 2.0. Обзор Granite 4.2 — это ориентированная на рассуждения версия семейства языковых моделей Granite. Более ранние версии Granite были сильными помощниками в следовании инструкциям; Гранит 4.2 добавляет явные аргументы. Каждая модель может генерировать цепочку мыслей перед ответом и может работать в режиме мышления или без мышления в зависимости от того, сколько обдумывания требует задача. Между этими двумя режимами находится режим с низкими усилиями, при котором на простые вопросы тратится небольшой бюджет на рассуждения. Три размера (3B, 8B и 30B) имеют один и тот же архитектурный дизайн и следуют одному и тому же конвейеру обучения (базовая модель, SFT, затем многоэтапное RL), каждый в своем собственном масштабе. Все трое — сильные мыслители и последователи наставлений. Наиболее четкое разделение способностей проявляется после обучения. Модели 8B и 30B дополнительно проходят агентный блок RL, который учит их действовать как агенты: вызывать инструменты, редактировать и запускать код, управлять терминалом и осуществлять поиск в сети в реальных средах. Каждая модель поддерживает вызов собственных инструментов. Обслуживаемый через конечную точку, совместимую с OpenAI (например, с помощью vLLM), он генерирует вызовы инструментов в формате вызова функций OpenAI и подключается к агентным связям без дополнительных усилий. Granite 4.2 также поддерживается в SGLang, готовый рецепт см. в кулинарной книге SGLang. Оставшаяся часть статьи посвящена сборке: архитектуре, предварительному обучению, контролируемой тонкой настройке, многоэтапному конвейеру RL и результатам. Архитектура модели Модели Granite 4.2 построены на архитектуре плотного трансформатора только с декодером и следующими основными компонентами: Предварительное обучение Модели Granite 4.2 проходят постобучение на основе базовых моделей Granite-4.1. Базовые модели Granite-4.1 были обучены с нуля примерно на 15 триллионах токенов с использованием пятиэтапной стратегии обучения. Фазы 1–2 сосредоточены на базовом предварительном обучении, этапы 3–4 выполняют промежуточное обучение с постепенно более качественным отжигом данных, а этап 5 представляет обучение с длинным контекстом, расширяя контекстное окно до 512 000 токенов. На каждом этапе используется отдельная смесь данных и график скорости обучения, постепенно переходя от широкомасштабных данных в Интернете к более тщательно подобранным и высококачественным источникам. Рецепт предварительной тренировки во многом повторяет рецепт предыдущего поколения; Подробную информацию о смешивании данных, графике этапов и расширении длинного контекста см. в блоге Granite 4.1. SFT: подготовка данных и контроль качества. Контролируемая точная настройка (SFT) превращает базовую модель в надежного помощника по следованию инструкциям, рассуждениям и использованию инструментов. Смесь данных SFT объединяет агентские (31,6%) и неагентские (68,4%) данные, в общей сложности около 7,2 миллиона выборок, или примерно 100 миллиардов токенов, из которых около 65 миллиардов являются обучаемыми. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.

Где захостить и как запустить

Планируете развернуть эту нейросеть?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
Хит цены
Aeza

Aeza

Москва★ 4.6

Shared Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

10 ГБ NVMe

Канал

200 Мбит/с

149 ₽/мес

Хит цены
Timeweb Cloud

Timeweb Cloud

Москва★ 4.8

Cloud Start

CPU

1 ядер • 3.3 ГГц

RAM

1 ГБ

Диск

15 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Aeza

Aeza

Москва★ 4.6

Shared Medium

CPU

2 ядер • 3.3 ГГц

RAM

2 ГБ

Диск

30 ГБ NVMe

Канал

200 Мбит/с

299 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐Data Center DynamicsAI-адаптация

Инвестиции в высокопроизводительное будущее: двухфазное иммерсионное охлаждение для трейдинга

Современные алгоритмические торговые системы и низколатентный трейдинг предъявляют экстремальные требования к серверному железу. Плотность размещения стоек постоянно растет, а традиционные воздушные системы охлаждения уже не справляются с отводом тепла от разогнанных CPU и GPU без критического оверхеда по энергии и шума. Переход на безводное двухфазное жидкостное охлаждение позволяет удерживать стабильные тактовые частоты без троттлинга даже при пиковых нагрузках на бирже. Ключевые преимущества двухфазного охлаждения для высоконагруженных серверных стоек: - **Нулевой риск протечек:** использование диэлектрических жидкостей с низкой температурой кипения исключает короткие замыкания при разгерметизации. - **Максимальная плотность:** эффективный отвод тепла позволяет уплотнять стойки, сокращая требования к площади машинного зала ЦОД. - **Энергоэффективность:** снижение PUE (Power Usage Effectiveness) за счет отказа от мощных вентиляторных групп. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Двухфазное иммерсионное охлаждение становится критическим фактором для поддержания стабильного и низколатентного тикинга в сверхплотных серверных стойках.
🌐ServeTheHomeAI-адаптация

NVIDIA представила Open Agent Safety Platform: изоляция ИИ-агентов на уровне ядра и BlueField-4 DPU

NVIDIA выкатила платформу безопасности Open Agent Safety Platform, призванную обуздать автономных ИИ-агентов и снизить риски неконтролируемого поведения моделей вроде Claude Code, Codex или Hermes. Ключевым элементом экосистемы стал открытый рантайм **OpenShell 0.1.0**, который не заменяет существующие фреймворки, а оборачивает их выполнение в изолированные песочницы с контролем на уровне ОС. Архитектура и возможности OpenShell: - **Изоляция песочниц:** Процесс-супервайзер инспектирует исходящий HTTP, GraphQL и MCP-трафик, а файловая система и процессы жестко ограничиваются на уровне ядра Linux. - **Декларативные политики:** Правила пишутся на YAML, компилируются в OPA Rego и позволяют тонко настраивать права (например, разрешить чтение репозиториев на GitHub при полном блокировании записи). - **Защита учетных данных:** Секреты хранятся вне рабочей нагрузки агента, а сетевые вызовы блокируются на уровне ядра, если песочница не имеет соответствующих прав. - **Аппаратное ускорение через NVIDIA Sentry:** На уровне железа защита масштабируется с помощью чипов NVIDIA Sentry, работающих на базе DPU BlueField-4 в системах Vera Rubin POD и интегрированных через NVIDIA DOCA для аудита и мониторинга. Проект уже поддержали более 100 компаний из экосистемы NVIDIA, что подчеркивает растущую боль администраторов с безопасностью автономных агентов, способных часами пытаться обойти ограничения в ходе тестов. ⚙️ Выбор хостинга: Подобрать надежный сервер с фильтром по 152-ФЗ, нужным локациям и Anti-DDoS защите можно через быстрый подбор на ServerSales (/wizard).

💡 Инсайт:Платформа NVIDIA OpenShell и DPU BlueField-4 переносят безопасность автономных ИИ-агентов на уровень ядра ОС и железа, закрывая критические бреши в корпоративных инсталляциях.
🌐PhoronixAI-адаптация

NVIDIA разрабатывает Display Config Server: новый подход к управлению видеостенами на Linux и Wayland

NVIDIA анонсировала разработку Display Config Server — специализированного решения, призванного упростить настройку и управление сложными конфигурациями дисплеев (видеостенами) в Linux-средах. Основной фокус сделан на улучшении работы с протоколом Wayland, который до сих пор вызывает сложности при масштабировании контента на несколько физических панелей. Ключевые аспекты проекта: * **Унификация управления:** Инструмент нацелен на устранение фрагментации при настройке многомониторных систем, что критично для профессиональных визуализационных комплексов. * **Оптимизация под Wayland:** Переход от устаревшего X11 к Wayland требует новых механизмов обработки композитинга, и Display Config Server должен закрыть этот пробел для enterprise-сегмента. * **Фокус на стабильность:** Решение направлено на повышение надежности отрисовки в высоконагруженных графических системах, где требуется синхронизация между множеством GPU и дисплеев. 🔍 Как выбрать сервер: Если вы планируете развертывание систем визуализации или высокопроизводительных графических станций, подобрать актуальные конфигурации серверов с поддержкой профессиональных GPU NVIDIA и найти оптимальные цены от проверенных провайдеров можно в каталоге ServerSales (/catalog).

💡 Инсайт:NVIDIA делает важный шаг к стандартизации управления видеостенами на Linux, что снизит порог входа для эксплуатации сложных графических систем на базе Wayland.