Подбор сервера под любую AI модель
Укажите интересующую вас модель (Llama, DeepSeek, Qwen, Mistral), чтобы мгновенно увидеть точные требования к VRAM, расчетную скорость генерации (токенов/сек) и список серверов с минимальной стоимостью аренды.
Выберите нейросеть для подбора оборудования
Алгоритм рассчитает вес модели, требуемый VRAM под разное квантование и подберет серверы с минимальной ценой
DeepSeek-V4.1-Flash
Флагманская 552B MoE модель, лидер для AI-агентов и кодинга. Обладает контекстом 1М токенов и высокой пропускной способностью за счет активации всего 16B параметров на токен.
Рекомендуемые конфигурации с гарантией совместимости
Каталог популярных моделей и детальные гайды
Отдельные страницы с тестами скорости, бенчмарками памяти и пошаговыми инструкциями развертывания
DeepSeek-V4.1-Flash
Флагманская 552B MoE модель, лидер для AI-агентов и кодинга. Обладает контекстом 1М токенов и высокой пропускной способностью за счет активации всего 16B параметров на токен.
DeepSeek R1 (Reasoning)
Революционная рассуждающая (reasoning) модель с архитектурой MoE (Mixture of Experts). Выдает развернутую цепочку размышлений (Chain-of-Thought) уровня OpenAI o1.
Command R+ 104B (Enterprise)
Индустриальная enterprise-модель от Cohere, специально оптимизированная для 10-шаговых RAG-пайплайнов, цитирования первоисточников и интеграции со сторонними базами данных.
Qwen 2.5 72B Instruct
Одна из сильнейших моделей в мире по математике, поддержке русского языка и структурированным данным (JSON/SQL). Отлично справляется со сложными русскоязычными инструкциями.
Llama 3.3 70B Instruct
Флагманская модель Meta открытого веса. Превосходит большинство коммерческих моделей в логике, мультиязычном общении и программировании при длине контекста до 128k.
Qwen 2.5 Coder 32B Instruct
Специализированная языковая модель для программирования. По тестам EvalPlus превосходит GPT-4o в кодогенерации, рефакторинге и поиске багов на 40+ языках программирования.
Gemma 2 27B Instruct
Модель нового поколения от Google DeepMind. По качеству аргументации и пониманию нюансов текстов превосходит многие более крупные модели с 70B параметрами.
Mistral Small 24B (NeMo / 24B)
Универсальная европейская модель от создателей Mistral. Прекрасно соблюдает системные промпты, идеальна для RAG-конвейеров и вызова функций (Function Calling / Tool Use).
DeepSeek Coder V2 Lite (16B MoE)
Архитектура смеси экспертов (MoE): активирует всего 2.4 млрд параметров на каждый сгенерированный токен, обеспечивая молниеносную скорость отклика при огромном запасе знаний.
Phi-4 14B Instruct
Маленький гигант от исследователей Microsoft. Обучена на тщательно отфильтрованных учебных данных и синтетическом датасете высочайшего качества. Лидер в бенчмарках рассуждений среди моделей до 15B.
Llama 3.1 8B Instruct
Золотой стандарт легковесных LLM. Обладает рекордным соотношением скорости к качеству. Идеальна для фоновых микросервисов, суммаризации и классификации запросов.
Qwen 3.8-Omni-Flash
Сверхбыстрая мультимодальная модель нового поколения от Alibaba. Способна обрабатывать текст, изображения и аудио в реальном времени с минимальной задержкой инференса.
Как рассчитать необходимый VRAM для локальной нейросети
Главная ошибка при выборе сервера для LLM — рассчитывать только чистый вес модели в гигабайтах. В реальности видеопамять (VRAM) видеокарты расходуется на три составляющие:
Зависят от формата квантования. В FP16 каждый миллиард параметров занимает 2 ГБ. В 4-битном квантовании (Q4_K_M, AWQ) — всего ~0.6–0.7 ГБ на миллиард параметров.
Хранит историю диалога. При контексте в 8k токенов требует около 1–2 ГБ VRAM, но при контексте в 64k–128k токенов KV-кэш может занять от 8 до 20 ГБ дополнительной видеопамяти.
Движки vLLM, Ollama, TGI резервируют от 1 до 2.5 ГБ VRAM под вычисления графов внимания и служебные структуры драйвера NVIDIA.
Формула безопасного выбора: для стабильного продакшн-инференса всегда закладывайте запас в 20–30% VRAM сверх размера квантованного файла модели. Если модель 70B в формате Q4 весит 39 ГБ, вам понадобится карта с 48 ГБ (например, NVIDIA L40S или 2x RTX 4090 по 24 ГБ).
Часто задаваемые вопросы по серверам для AI
Можно ли запускать LLM на обычном CPU без видеокарты?
Да. Модели до 8–14 млрд параметров (Llama 3.1 8B, Phi-4) через движок llama.cpp отлично работают на современных многоядерных CPU (AMD EPYC, Intel Xeon). Скорость составит от 10 до 25 токенов в секунду, что идеально для чат-ботов и фоновых скриптов при цене сервера всего 1 500–3 000 руб/мес.
В чем разница между RTX 4090 и серверными A100 / H100?
RTX 4090 имеет 24 ГБ быстрой GDDR6X памяти и дает максимальную скорость на один поток при скромной цене аренды (~30-35 тыс. руб/мес). A100/H100 обладают 80 ГБ памяти HBM2e/HBM3 с пропускной способностью до 2–3 ТБ/с, поддерживают шину NVLink и позволяют запускать огромные модели без сильного квантования в режиме высоких параллельных нагрузок.
Что выбрать: Ollama, vLLM или TGI?
Для персонального использования, тестирования и несложных ботов лучше всего подходит Ollama (разворачивается за 1 минуту, REST API совместим с OpenAI). Для высоких нагрузок, непрерывного батчинга (continuous batching) и коммерческих API стандартом индустрии является vLLM.
Теряется ли качество ответов при 4-битном квантовании (Q4_K_M)?
По современным тестам потеря качества при переходе с FP16 на 4-битное квантование Q4_K_M или AWQ составляет менее 1.5–2% в перплексии, при этом потребление памяти снижается в 3.5 раза. Это общепринятый стандарт для подавляющего большинства бизнес-задач.