Ко всем новостям
🌐Hugging Face BlogAI-адаптировано

TextQuests: новый бенчмарк для проверки LLM-агентов на играх с текстовой механикой

Инсайт ServerSales • Влияние на рынок

TextQuests задает новый стандарт для оценки автономных LLM-агентов, нагружая их память и логику комплексными сценариями с длинным контекстом.

Исследователи представили бенчмарк TextQuests, разработанный на базе 25 классических текстовых квестов Infocom. Этот инструмент создан для стресс-тестирования больших языковых моделей (LLM) в роли автономных агентов, способных действовать в неструктурированных средах без внешних инструментов. ### Ключевые особенности бенчмарка: * Длинный контекст (Long-Context Reasoning): Игры требуют выстраивания многошаговых стратегий на основе сотен последовательных действий и растущей истории сессии без урезания контекста. * Обучение через исследование: Модели должны адаптироваться к неудачам, исправлять ошибки методом проб и ошибок в неизведанном виртуальном мире. * Двойной прогон и метрики: Тестирование проводится в двух режимах — с подсказками (With Clues) и без них (No Clues) в пределах до 500 шагов. Помимо игрового прогресса, оценивается и показатель вредоносности (Harm) по нежелательным действиям. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).

Где захостить и как запустить

Планируете развернуть эту нейросеть?

На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.

Первоисточник материала
Новость опубликована в издании Hugging Face Blog.
Вы можете прочитать полную версию статьи и комментарии на сайте источника.
Читать на Hugging Face Blog
Проверенные провайдеры под задачи материала

Надежные облачные платформы и серверы в РФ

Весь каталог
SelectelTier III • 152-ФЗ
★ 4.9

Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.

Бонус до 3 000 ₽ на облачную платформу
Перейти в Selectel
Timeweb CloudNVMe • Anti-DDoS
★ 4.8

Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.

Скидка 20% на первый заказ VPS
Перейти в Timeweb Cloud
Рекомендуемые конфигурации по теме
В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 3090 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 3090 (24 ГБ GDDR6X)

39 ₽/час

24 999 ₽/мес

В наличииGPU
Timeweb Cloud

Timeweb Cloud

Россия★ 4.8

GPU RTX A5000 24GB

CPU

8 ядер

RAM

64 ГБ

Диск

500 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX A5000 (24 ГБ GDDR6X)

36 ₽/час

24 999 ₽/мес

В наличииGPU
Hostkey

Hostkey

Россия★ 4.3

GPU RTX 4090 24GB

CPU

16 ядер

RAM

128 ГБ

Диск

1000 ГБ NVMe

Канал

1 Гбит/с

GPU

NVIDIA RTX 4090 (24 ГБ GDDR6X)

47 ₽/час

32 999 ₽/мес

Каталог серверов ServerSales

Ищете точную конфигурацию под ваш бюджет?

Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.

Другие новости индустрии

🌐PhoronixAI-адаптация

Linux получает патчи для 144-ядерного ARM-процессора Fujitsu MONAKA

Разработчики начали интеграцию программных обходных путей (workarounds) в ядро Linux для нового серверного ARM-процессора Fujitsu MONAKA, анонсированного месяц назад. Чип позиционируется как мощное решение для инфраструктуры искусственного интеллекта и дата-центров, предлагающее впечатляющие 144 вычислительных ядра на базе архитектуры ARM. Процесс подготовки софта к релизу MONAKA ведется уже около двух лет — ранее патчи для поддержки процессора появлялись в компиляторе GCC и других ключевых open-source компонентах. Появление патчей для ядра Linux говорит о том, что кремний переходит в финальную стадию готовности к реальным нагрузкам и развертыванию на «железе». Основные технические особенности обновления: * Интеграция специфичных для кремния Fujitsu испровлений в подсистему ядра Linux. * Подготовка инфраструктуры под 144-ядерные ARM-чипы высокой плотности. * Фокус на оптимизацию под ИИ-нагрузки и плотные вычисления. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Подготовка ядра Linux к поддержке Fujitsu MONAKA знаменует выход нового 144-ядерного ARM-игрока на рынок серверного железа для дата-центров и ИИ.
#Серверы#ИИ_и_GPU
Дайджест ServerSalesЧитать на источнике
🇷🇺Хабр / Хостинг

Шрифты, CDN и хостинг: трансграничная передача, которую никто не замечает

Я делаю сервис, через который проходят чужие договоры, поэтому к 152-ФЗ отношусь внимательнее многих. Документы, формы, вход - всё уходит на сервер в России, это я проверял не раз. А на прошлой неделе решил проверить не сервис, а сам сайт - просто посмотреть, к каким доменам обращается браузер, когда человек открывает главную. Нашёл три иностранных компании. Ни одну из них я туда сознательно не звал. Читать далее 💡 **Где захостить и как запустить:** рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на **ServerSales** в интерактивном [подборщике AI-моделей](/ai) или [каталоге GPU-серверов](/gpu).

🌐ServeTheHomeAI-адаптация

NVIDIA запускает DGX Spark 64GB по $4999 и поднимает цены на 128GB версию: ценовая война в сегменте AI-систем

NVIDIA перетряхивает экосистему компактных AI-систем на базе чипов GB10, реагируя на меняющийся рынок и рост спроса на агентный софт. На фоне резкого скачка стоимости старшей модели DGX Spark 128GB до $6950 компания выкатывает более доступную модификацию с 64GB на борту со стартовым ценником в $4999. Главные изменения и особенности нового железа: * **Младшая модель DGX Spark 64GB:** Доступна через партнёров (Acer, ASUS, Dell, Gigabyte, HP, MSI) по цене от $4999. При этом сохраняется фирменный сетевой стек NVIDIA ConnectX-7 200GbE. * **Удорожание старшей линейки:** Цена 128GB версии подскочила почти до $6950 (год назад старт был с $3999), что заставляет инженеров пересчитывать экономику инфраструктуры. * **Кластеризация:** NVIDIA предлагает собирать кластеры из двух 64GB нод (~$10 000 суммарно) как альтернативу дорогому одиночному железу, хотя экспертный опыт показывает, что лучше масштабироваться вертикально (scale-up), выбирая единую систему с максимальным объемом памяти. * **Конкуренция:** Новые цены ставят GB10 в жесткие рамки против будущих систем AMD Gorgon Halo с памятью до 192GB и мощных решений от Apple. 🔍 Как выбрать сервер: Сравнить актуальные конфигурации серверов на базе этого оборудования и найти минимальные цены от проверенных провайдеров РФ и Европы можно в каталоге ServerSales (/catalog).

💡 Инсайт:Рост цен на NVIDIA DGX Spark заставляет по-новому взглянуть на TCO локальных AI-кластеров и жестче выбирать между вертикальным масштабированием и сетевыми оверхедами.