NVIDIA Groq 3: SRAM, дезагрегация, детерминизм
LPU Groq в корне отличаются от ИИ-ускорителей NVIDIA, но именно таких чипов компании и не хватало для платформы нового поколения — гетерогенной, дезагрегированной и подходящей для агентского ИИ. Разбираем особенности LP30 и LPX и выясняем, почему детерминированный инференс — это хорошо Самая крупная за всю историю NVIDIA сделка — приобретение Groq за $20 млрд — начала приносить первые плоды. Компания интегрировала архитектурно чуждые ИИ-ускорители LPU в свою ИИ-платформу Vera Rubin , чтобы резко ускорить инференс, сделав его дезагрегированным, а платформу — гетерогенной. Именно LPU помжет удовлетворить требования к низкой задержке при интерактивной работе с ИИ и быстроте обработке большого контекста в агентных системах. При этом об анонсированных ранее соускорителях Rubin CPX компания теперь предпочитает не вспоминать. Система LPX обеспечивает ИИ-фабрику движком, оптимизированным для быстрой и предсказуемой генерации токенов, в то время как Vera Rubin NVL72 выступает в роли гибкого универсального инструмента для обучения и инференса, обеспечивая высокую пропускную способность на этапах предварительного заполнения и декодирования, включая обработку длинного контекста, работу механизма внимания и обслуживание систем с высокой степенью параллелизма в масштабе. Такое сочетание необходимо, поскольку будущее агентов требует новой категории инференса. По мере того как скорость генерации приближается к 1000 токенов/с (TPS) на каждого пользователя, модели выходят за рамки взаимодействия со скоростью человеческого разговора, говорит NVIDIA. При таких темпах ИИ-системы могут постоянно рассуждать, моделировать и реагировать, что позволяет им взаимодействовать не столько в пошаговом чате, сколько в режиме совместной работы в реальном времени. Этот сдвиг также повышает планку для мультиагентных систем. Для обработки новых рабочих нагрузок требуется инфраструктура, способная обеспечить как высокую пропускную способность инференса, так и низкую задержку. Объединение Vera Rubin NVL72 с Groq 3 LPX как раз и формирует гетерогенную архитектуру, сочетающую производительность крупномасштабной ИИ-фабрики с быстрой генерацией токенов. Vera Rubin NVL72 с Groq 3 LPX обеспечивают более высокую пропускную способность при более высоких уровнях интерактивности — в 35 раз быстрее по сравнению с системами Grace Blackwell NVL72 при 400 TPS на пользователя. С платформой Vera Rubin ИИ-предприятия могут получать до пяти раз больше дохода на МВт по сравнению с GB200 NVL72 и до 10 раз — за счёт сопряжения Vera Rubin NVL72 с LPX для наиболее чувствительных к задержкам и высокопроизводительных интерактивных рабочих нагрузок, таких как агентное кодирование и мультиагентные системы. LPX предоставляет ЦОД возможность развернуть выделенный канал интерактивного инференса с низкой задержкой наряду с Vera Rubin NVL72 в рамках общей инфраструктуры. 160-КВт стоечный суперускоритель NVIDIA Groq 3 LPX содержит 256 ИИ-чипов Groq 3 (LP30) с 96 млрд транзисторов в каждом — 32 узла высотой 1U с СЖО, объединяющих по восемь ускорителей LPU, x86 CPU, до 128 Гбайт RAM (возможно расширение до ещё плюс 256 Гбайт) и сетевые компоненты в бескабельной конструкции MGX, что упрощает развёртывание в стойке и обеспечивает тесную связь между вычислениями и коммуникацией. С2С-интерконнект RealScale обеспечивают прямую связь LPU внутри узла, между узлами и между стойками. На системном уровне LPX создан для использования в режимах инференса, где затраты на координацию и джиттер могут быстро стать заметными для пользователей. NVIDIA Groq 3 LPU разработан для обеспечения быстрой и предсказуемой генерации токенов за счёт тесного взаимодействия вычислений, памяти и обмена данными под управлением компилятора. Вместо оптимизации для достижения максимальной арифметической производительности LPU делает упор на детерминированное выполнение, высокую пропускную способность встроенной памяти и явное перемещение данных. Делая перемещение данных явным и программируемым, LPU позволяет перекрывать операции доступа к памяти, вычисления и обмен данными, не полагаясь на аппаратную эвристику и скрывая задержки. 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.