NVIDIA представила Llama Nemotron Nano VL: мультимодальную VLM-модель для распознавания документов и OCR
Выход Llama Nemotron Nano VL дает инженерам готовый инструмент для автоматизации документооборота с поддержкой сложных визуальных элементов и возможностью дообучения под корпоративные задачи.
NVIDIA пополнила семейство моделей Nemotron новой разработкой — Llama Nemotron Nano VL. Это компактная мультимодальная модель (Vision-Language Model), созданная для интеллектуальной обработки документов (IDP) и продвинутого OCR. В основе решения лежит связка архитектуры Llama-3.1-8B-Instruct и визуального энкодера C-RADIOv2-VLM-H на базе Vision Transformer (ViT). Модель оптимизирована для извлечения информации из сложных документов: PDF-файлов, графиков, таблиц и формул, демонстрируя высокую точность в бенчмарке OCRBench v2. Главные технологические особенности: * Динамическая агрегация патчей: поддержка высокоразрешенного ввода произвольных соотношений сторон без потери глобального контекста и мелких деталей (например, шрифтов или сложных схем). * Элементный анализ: высокая точность при парсинге таблиц, инвойсов, графиков и диаграмм с поддержкой баундинг-боксов (grounding). * Возможности дообучения: модель доступна на Hugging Face Hub, а инженеры могут проводить post-training на собственных датасетах с помощью фреймворка NVIDIA NeMo. 💡 Где захостить и как запустить: Рассчитать точный VRAM под кванты этой модели, скорость генерации (токенов/сек) и выбрать подходящий сервер с GPU можно у нас на ServerSales в калькуляторе AI-моделей (/ai) или каталоге GPU (/gpu).
Планируете развернуть Llama 3.3?
На ServerSales вы можете рассчитать точные требования к VRAM под разные типы квантования (4-bit Q4 / FP8 / FP16), оценить скорость генерации (токенов/сек) и сразу подобрать проверенный сервер с GPU от ведущих провайдеров.
Надежные облачные платформы и серверы в РФ
Крупнейший IaaS-провайдер РФ: облачные VPS, Bare Metal серверы и GPU-кластеры для ИИ.
Скоростные VPS от 299 ₽/мес, почасовая тарификация, готовые образы и GPU RTX 4090 / A100.
Hostkey
GPU RTX 3090 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 3090 (24 ГБ GDDR6X)
24 999 ₽/мес
Timeweb Cloud
GPU RTX A5000 24GB
CPU
8 ядер
RAM
64 ГБ
Диск
500 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX A5000 (24 ГБ GDDR6X)
24 999 ₽/мес
Hostkey
GPU RTX 4090 24GB
CPU
16 ядер
RAM
128 ГБ
Диск
1000 ГБ NVMe
Канал
1 Гбит/с
GPU
NVIDIA RTX 4090 (24 ГБ GDDR6X)
32 999 ₽/мес
Ищете точную конфигурацию под ваш бюджет?
Используйте наш интерактивный мастер подбора: рассчитайте точные ресурсы CPU, RAM и диска за 3 шага.