Одно семейство моделей, два результата золотого уровня: точная настройка немотрона для IOI и IMO
Наши недавние результаты показывают, что Nemotron является прочной и адаптируемой основой для создания специализированных моделей мирового класса. Начиная с Nemotron 3, наши команды использовали контролируемую точную настройку (SFT), обучение с подкреплением (RL) и вывод на основе обратной связи для создания систем, которые достигли уровня золотой медали как на IMO 2026, так и на IOI 2026. Результат IOI был получен в результате живого предполагаемого забега с теми же ограничениями по времени, доступу в Интернет и подачами заявок, что и у участников-людей. Это был неофициальный неконтролируемый тест, который не был включен в официальный рейтинг IOI. Представленные в систему IMO доказательства были оценены официальными экспертами IMO. Многоразовый рецепт специализации «Легко настроить» должен означать нечто большее, чем просто создание обучаемой контрольной точки. Это должно означать, что эффективная модель фундамента может быть адаптирована к требовательной области с помощью четкого рецепта многократного использования. В обоих проектах этот рецепт состоял из четырех частей: Обучение и прогоны вывода были значительными, но лежащий в их основе подход знаком и воспроизводим. Нам не нужно было создавать новую модель фундамента для каждой задачи. Мы специализируемся на Nemotron для этой задачи. От общих навыков программирования до золота IOI. Для соревновательного программирования мы разработали 22 000 задач и создали синтетические логические следы для обучения двух специалистов. Немотрон-3-Нано-СС с 30 миллиардами общих параметров и 3 миллиардами активных параметров получил как SFT, так и RL. Немотрон-3-Ультра-СС с 550 миллиардами общих параметров и 55 миллиардами активных параметров получил SFT. Развитие IOI 2025 позволяет легко увидеть ценность специализации. Нано улучшился со 130 баллов до пост-тренировки до 280 после SFT и 291 после RL. С GenCorrect, нашей итеративной стратегией генерирования-оценки-уточнения, он достиг 468 пунктов и преодолел золотой порог в 438,3. Ultra-CC набрал 502 балла при той же стратегии тестирования. Эти эксперименты также показали, что адаптация не обязательно должна выглядеть одинаково на всех уровнях. SFT обеспечил большую часть прироста Nano, а RL добавил небольшое, но последовательное улучшение. Для более мощной модели Ultra одной эпохи SFT было достаточно, чтобы превзойти полностью постобученную модель Nano по IOI, ICPC и LiveCodeBench Pro. Этот вывод лег в основу специальной системы Ultra-CC, использованной для IOI 2026, которая набрала 535,4 балла из 600. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.