Ко всем новостям
🌐Hugging Face BlogAI-адаптировано

Укрощение очередей в vLLM: как параллельный префилл борется с блокировкой коротких запросов длинными промптами

Инсайт ServerSales • Влияние на рынок

Оптимизация очередей префилла в vLLM критически важна для снижения Time-to-First-Token в production-окружениях с неравномерной длиной входящих промптов.

Разработчики vLLM обратили внимание на классическую проблему инференса LLM: длинные промпты блокируют очередь префилла (prefill-queue), из-за чего последующие короткие запросы простаивают, демонстрируя удручающий Time-to-First-Token (TTFT). Поскольку этап префилла полностью утилизирует GPU параллельной обработкой токенов, стандартный chunked-prefill обрабатывает чанки строго последовательно. В недавних обновлениях vLLM появился механизм параллельного префилла с ограничением (request-parallel prefills). Теперь система умеет батчить префиллы нескольких запросов одновременно, но с жестким лимитом на количество «тяжелых» промптов (например, разрешено обрабатывать пачку коротких запросов параллельно, но только один из них может содержать более 10 000 токенов). Это создает своеобразную «выделенную полосу» для коротких промптов, кардинально снижая задержки на старте генерации, хотя одновременное выполнение префилла и декодирования все еще может незначительно просаживать скорость генерации токенов (TPOT) для уже запущенных задач. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).

Где захостить и как запустить

Планируете развернуть эту нейросеть?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 3090 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 3090 (24 ГБ GDDR6X)

39 ₽/час

24 999 ₽/мес

В наличииGPU
Timeweb Cloud

Timeweb Cloud

Россия★ 4.8

GPU RTX A5000 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX A5000 (24 ГБ GDDR6X)

36 ₽/час

24 999 ₽/мес

В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 4090 24GB

CPU

16 ядер

RAM

128 ГБ

Диск

1000 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 4090 (24 ГБ GDDR6X)

47 ₽/час

32 999 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐ServeTheHomeAI-адаптация

Рабочая станция Gigabyte W775-V10-L01 на базе NVIDIA GB300: полноценный суперкомпьютер прямо под столом

Компания Gigabyte представила уникальную десктопную рабочую станцию W775-V10-L01 на базе архитектуры NVIDIA Grace Blackwell Ultra (GB300), объединяющую мощь полноценного серверного решения в форм-факторе башенного ПК. Система оснащена 72-ядерным процессором Grace CPU, графическим чипом Blackwell Ultra с высокоскоростной памятью HBM3E и интерфейсом C2C, а также двухпортовым сетевым адаптером ConnectX-8 с поддержкой RDMA 400Gbps. Главные технические особенности и производительность: * **Инференс моделей:** На модели Qwen3.6-35B-A3B Flash NVFP4 система демонстрирует колоссальную скорость генерации — **более 26 000 токенов в секунду** (что эквивалентно 2.25 млрд токенов в сутки). * **Энергопотребление и охлаждение:** Максимальное энергопотребление устройства составляет 1.6 кВт, благодаря чему его можно запитать от стандартной розетки 120V. При этом система укомплектована эффективной кастомной СЖО. * **Вес и габариты:** Корпус высотой 50 см и глубиной 53 см весит около 29 кг, что требует командного подъема при монтаже. 💡 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Гибридная десктоп-станция GB300 стирает грань между дата-центром и локальным рабочим местом инженера, обеспечивая беспрецедентную скорость инференса тяжелых LLM в компактном корпусе.
🌐Data Center DynamicsAI-адаптация

Google заключил сделку на 3.6 ГВт с Constellation Energy: дата-центры запитают от атомной и газовой генерации

Google продолжает агрессивно обеспечивать свои дата-центры гарантированным энергоснабжением, заключив масштабное соглашение с энергетическим гигантом Constellation Energy. Договор объемом 3.6 ГВт охватывает ключевые рынки ЦОД в зоне обслуживания регионального оператора электросетей PJM (включая штаты Вирджиния, Огайо и Пенсильвания), которые испытывают дефицит свободных мощностей из-за бума искусственного интеллекта и ML-кластеров. В условиях, когда современные ИИ-фермы требуют десятков и сотен мегаватт на стойку, традиционные энергосети не успевают за темпами ввода инфраструктуры. Новый контракт делает ставку на надежные источники базовой нагрузки — атомную энергетику и высокоманевренные газовые генераторы. Это позволит Google обходить ограничения регуляторов на подключение к перегруженным подстанциям и обеспечивать бесперебойную работу критически важных вычислений 24/7. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Энергодефицит в ключевых хабах ЦОД заставляет облачных гигантов напрямую инвестировать в атомную генерацию для питания ИИ-кластеров.
🌐PhoronixAI-адаптация

Тесты NVIDIA Vera HPC: бросаем вызов AMD EPYC и Intel Xeon в классических суперкомпьютерных задачах

Пока индустрия поголовно увлечена исключительно искусственным интеллектом, NVIDIA продолжает прокачивать свои серверные процессоры для традиционного HPC (высокопроизводительных вычислений). В центре внимания оказались процессоры NVIDIA Vera с кастомными ядрами Olympus и пропускной способностью памяти LPDDR5x на уровне 1.2 ТБ/с. Первые независимые тесты на двухъядерных серверах Vera, развернутых в лабораториях вроде Лос-Аламоса, показывают, как эти CPU конкурируют с тяжеловесами от AMD EPYC и Intel Xeon. Главные инженерные особенности платформы NVIDIA Vera в HPC-нагрузках: * **Пропускная способность памяти:** 1.2 ТБ/с на базе LPDDR5x дает серьезный прирост в задачах, ограниченных скоростью памяти (memory-bound). * **Энергоэффективность и частоты:** Тесты демонстрируют детальное поведение процессора под максимальной нагрузкой, включая мониторинг энергопотребления и тактовых частот. * **Конкуренция с x86:** Vera уверенно заходит на территорию, традиционно удерживаемую топовыми линейками AMD EPYC (Zen 4/Zen 5) и Intel Xeon Scalable, предлагая альтернативный ARM-подход для научных и инженерных расчетов. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Процессоры NVIDIA Vera доказывают свою эффективность не только в ИИ, но и в традиционном HPC благодаря колоссальной пропускной способности памяти LPDDR5x, создавая реальную конкуренцию x86-решениям от AMD и Intel.