Google представила EmbeddingGemma: компактную мультиязычную модель для векторизации текста
EmbeddingGemma снижает порог входа для развертывания локальных систем семантического поиска и RAG, обеспечивая высокую скорость векторизации при минимальном потреблении ресурсов.
Google DeepMind выпустила EmbeddingGemma — новую легковесную модель для генерации текстовых эмбеддингов, созданную на базе архитектуры Gemma 3. Модель ориентирована на построение систем семантического поиска, RAG-пайплайнов и классификации документов, предлагая высокую производительность при минимальных системных требованиях. Ключевые технические особенности EmbeddingGemma: * Параметры и размер: всего 308 млн параметров, в квантованном виде модель занимает менее 200 МБ оперативной памяти. * Архитектура: модифицированный энкодер на базе Gemma 3 с двунаправленным вниманием (bi-directional attention) вместо казуального. * Контекстное окно: поддержка последовательностей длиной до 2048 токенов. * Мультиязычность: поддержка более чем 100 языков с лидирующими результатами в бенчмарке MMTEB. * Matryoshka Representation Learning (MRL): возможность «на лету» усекать 768-мерный вектор до 512, 256 или 128 измерений без существенной потери точности для оптимизации поиска и хранения. Модель из коробки интегрируется с популярными экосистемами: Sentence Transformers, LangChain, LlamaIndex, Haystack, Text Embedding Inference (TEI) и ONNX Runtime, что позволяет быстро внедрить ее в существующие ML-пайплайны. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть Llama 3.3?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.