CPU против GPU для нейросетей: когда можно обойтись сервером за 2 000 рублей в месяц
Реальные замеры скорости инференса открытых LLM на процессорах AMD EPYC и Intel Xeon. В каких сценариях покупка дорогой видеокарты — пустая трата денег, а где без CUDA не обойтись.
Если вам нужен бот для Telegram, обработка входящих заявок в CRM или ночной парсинг документов на моделях до 14 млрд параметров (Llama 3.1 8B, Phi-4, Qwen 2.5 7B), вам не нужна видеокарта. Арендуйте VPS с 4–8 vCPU и 16–32 ГБ RAM на быстром NVMe за 1 800–3 500 руб/мес. Вы сэкономите более 300 000 рублей в год, получая стабильные 12–20 токенов в секунду.
- Аренда GPU-сервера стоит от 30 000 до 120 000 руб/мес, тогда как мощный VPS на CPU обойдется всего в 1 500–4 000 руб/мес.
- Для фоновых задач (суммаризация писем, парсинг данных, модерация комментариев) скорости 10–15 токенов в секунду на CPU более чем достаточно.
- Благодаря оптимизациям llama.cpp под наборы инструкций AVX-512 и AMX современные серверные процессоры тянут квантованные модели 8B–14B без видеокарт.
- Видеокарта критически необходима в двух случаях: интерактивный чат с высокими требованиями к Time to First Token (TTFT) и одновременная работа десятков пользователей.
Сравнение стоимости и скорости инференса на CPU и GPU серверах
| Конфигурация | Стоимость/мес | Модель | Скорость генерации | Цена 1 млн токенов |
|---|---|---|---|---|
| VPS 4 vCPU / 16 GB RAM (DDR4) | ~1 890 ₽ | Llama 3.1 8B (Q4) | 10–13 т/с | ~6 ₽ |
| VPS 8 vCPU / 32 GB RAM (DDR5) | ~3 890 ₽ | Llama 3.1 8B (Q4) | 18–24 т/с | ~4 ₽ |
| VPS 8 vCPU / 32 GB RAM (DDR5) | ~3 890 ₽ | Phi-4 14B (Q4) | 9–12 т/с | ~8 ₽ |
| GPU RTX 4090 24GB | ~34 990 ₽ | Llama 3.1 8B (Q4) | 95–120 т/с | ~25 ₽ (при малой нагрузке) |
| GPU RTX 4090 24GB | ~34 990 ₽ | Qwen 2.5 32B (Q4) | 50–65 т/с | ~35 ₽ |
| GPU A100 80GB | ~129 990 ₽ | Llama 3.3 70B (FP8) | 40–50 т/с | ~80 ₽ |
Миф: Нейросети не работают без видеокарты
Еще два года назад инференс на центральном процессоре действительно напоминал пытку: модель 7B едва выдавала 2–3 токена в секунду. Однако с появлением проекта llama.cpp Георга Герганова и тотальной оптимизации под векторные инструкции AVX2, AVX-512 и Intel AMX ситуация кардинально изменилась.
Современный 8-ядерный процессор AMD EPYC 9004 или Intel Xeon 4-го поколения с быстрой оперативной памятью DDR5 4800+ МГц генерирует текст на квантованной модели Llama 3.1 8B со скоростью около 18–22 токенов в секунду. Человек читает текст со средней скоростью 4–5 слов (токенов) в секунду. Это значит, что для большинства сценариев поток текста генерируется в 3–4 раза быстрее, чем пользователь успевает его читать!
Когда видеокарта действительно незаменима
Экономия на CPU оправдана далеко не всегда. Видеокарта с аппаратными ядрами Tensor Core и быстрой памятью становится обязательной в следующих ситуациях:
1. **Модели размером 70B и выше.** Запустить Llama 3.3 70B на CPU можно (потребуется 64 ГБ RAM), но скорость составит 1–3 токена в секунду. Генерировать ответ на сложный вопрос придется полторы минуты.
2. **Высокая параллельная нагрузка.** На CPU один долгий запрос может заблокировать все ядра на 100%. На GPU благодаря пакетной обработке vLLM одна карта RTX 4090 может параллельно генерировать ответы для 10–15 пользователей одновременно без потери плавности.
3. **Обработка изображений и эмбеддингов.** Пакетная векторизация миллионов текстов для RAG или генерация картинок через Stable Diffusion на CPU работают медленно и неэффективно.
Проверенные серверы от надежных провайдеров
Aeza
Shared Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
10 ГБ NVMe
Канал
200 Мбит/с
149 ₽/мес
Beget
VPS 1
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
20 ГБ NVMe
Канал
200 Мбит/с
199 ₽/мес
Timeweb Cloud
Cloud Start
CPU
1 ядер • 3.3 ГГц
RAM
1 ГБ
Диск
15 ГБ NVMe
Канал
200 Мбит/с
299 ₽/мес
Часто задаваемые вопросы (FAQ)
Что важнее для скорости на CPU: количество ядер или частота?
Важнее всего пропускная способность памяти (Memory Channels и частота RAM в МГц), а также тактовая частота ядра на один поток. Брать 64 медленных ядра бессмысленно — оптимально 8–16 быстрых ядер с максимальной частотой (3.7–4.5 ГГц).