BenchMIRT: новый фреймворк для глубокого аудита бенчмарков LLM на уровне промптов
BenchMIRT позволяет инженерам и исследователям детально разделять скрытые метрики безопасности и логики в LLM, уходя от слепого доверия агрегированным скорам бенчмарков.
Исследователи представили BenchMIRT — метод аудита языковых моделей, который анализирует бенчмарки не целиком, а на уровне отдельных промптов и задач. Большинство современных тестов (например, на безопасность, логику или следование инструкциям) на практике смешивают сразу несколько навыков. К примеру, тест на возрастные предрассудки BBQ требует от модели не только отсутствия стереотипов, но и сильных навыков логического вывода и удержания контекста. В основе BenchMIRT лежит многомерная теория ответа на пункт (multidimensional IRT, MIRT), заимствованная из психометрики. Метод оценивает каждый вопрос по степени сложности и способности разделять сильные и слабые модели по разным векторам возможностей. * Охват данных: Метод уже протестирован на результатах 100 LLM, 16 бенчмарках и более чем 34 тысячах вопросов. * Разделение метрик: Фреймворк позволяет отделить общие рассуждения от навыков безопасности (на базе тестов MMLU-Pro, GPQA, MATH, HarmBench, WildJailbreak и др.). * Устранение шума: Помогает инженерам понять, что именно на самом деле измеряет итоговый скор модели, исключая слепое усреднение разнородных метрик. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.