Как VK c РСК в серверы СЖО внедряли
Экосистему проектов VK сейчас обслуживают порядка 60 тыс. серверов, которые потребляют не один десяток мегаватт. Ежегодно к ним добавляется не менее 5 тыс. новых машин, причём всё более мощных. А вот электроэнергия дешевле не становится и с этим надо что-то делать При построении и обслуживании инфраструктуры такого масштаба требуется учитывать массу параметров, среди которых даже самый незначительный на первый взгляд может кардинально повлиять на совокупную стоимость владения (Total Cost of Ownership, TCO), к минимизации которой стремятся все гиперскейлеры. Как происходит процесс выбора оборудования и почему решили попробовать систему жидкостного охлаждения (СЖО) в серверах, нам рассказал Станислав Закиров, директор по развитию инфраструктуры VK. В случае VK — а это не только ВКонтакте, но и масса других сервисов, включая Одноклассники, Mail.RU, Ситимобил, Delivery Club и т. д. — подход к построению инфраструктуры значительно изменился за последние несколько лет. За выбор аппаратной платформы отвечает отдельная тестовая лаборатория, которая изучает массу «железа», в том числе ещё не вышедшего. Одним из важнейших параметров при выборе является производительность на ватт, поскольку этот параметр оказывает драматичное влияние на будущие операционные затраты и, следовательно, на оценку TCO. Первичный отбор идёт с опорой на синтетические тесты, но затем кандидаты попадают в руки инженеров, которые смотрят как они справляются с реальными нагрузкой, данными и в реальном же окружении. С CPU снимается масса метрик, включая, например, уровень загрузки, время отклика, промахи кеша и т. д. Основное требование — чтобы новая система справлялась с задачами наиболее требовательных и крупных внутренних заказчиков максимально эффективно с точки зрения затрат на единицу полезной производительности. Излишние для менее требовательных задач мощности всё равно до определённой степени утилизируются, в чём помогает переход к облачной модели (в частности, контейнеризации и виртуализации) и программно определяемым решениям вкупе с грамотной оркестрацией. Собственно говоря, на данном этапе развития VK подошла к логическому концу — все новые машины имеют унифицированную платформу с единственным вариантом процессора, на которой строятся и CPU-узлы, и GPU-узлы, и СХД. Текущее поколение серверов базируется на двухсокетных платформах с Intel Xeon Platinum 8380 (40C/80T, 2,3/3,40 ГГц, L3-кеш 60 Мбайт, TDP 270 Вт). Проще говоря, используется самый старший процессор Intel на текущий момент. CPU теперь только один и платформа тоже одна. Закупаются они всё в больших объёмах, что значительно удобнее и выгоднее с точки зрения обслуживания и позволяет получить существенный выигрыш в цене. Настолько существенный, что даже использование двух-трёх платформ с отличающимися CPU и периферией в нынешних условиях и с текущими запросами VK оказывается в среднем дороже. И это даже без учёта дополнительных факторов вроде дозакупки CPU и прочих компонентов в будущем, ведь чем больше используемый ассортимент, тем труднее это будет сделать. Но у каждого гиперскейлера своя, очень интересная математика. Можно посмотреть, к примеру, на дизайн OCP-серверов Meta ✴ (Facebook ✴ ), а ещё лучше — на новые платформы AWS, которая «достигла вершин». AWS использует преимущественно собственные ЦОД и активно переходит на платформу с собственными же CPU Graviton3 . Что и приводит нас к вопросу об операционных расходах, а точнее о балансе между CAPEX и OPEX. У VK сейчас всего два собственных дата-центра — в Москве и Санкт-Петербурге, а всё остальное приходится на арендованные площадки в других ЦОД, причём далеко не всегда самых новых. Это имеет свои последствия. Повышение плотности размещения вычислительных мощностей в рамках одного узла приводит к необходимости более сложных калькуляций для питания и охлаждения в рамках стойки и, далее, ЦОД. Так, для новой платформы было выбрано 2U-шасси просто потому, что в него можно поставить более крупные вентиляторы, снизив их скорость вращения и энергопотребление, которое быстро растет по мере увеличения нагрузки на «железо». 💡 Где захостить и как запустить: рассчитать точные требования к объёму VRAM под разные типы квантования этой модели (4-bit Q4, FP8, FP16), оценить скорость генерации токенов в секунду и подобрать совместимый сервер с GPU можно на ServerSales в интерактивном подборщике AI-моделей или каталоге GPU-серверов.
Планируете развернуть эту нейросеть?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.