Для каких задач лучше всего подходит Mistral Small 24B (NeMo / 24B)?
Модель разработана компанией Mistral AI и включает 24 млрд параметров. Благодаря архитектуре глубоких трансформеров и обучению на обширном корпусе текстов модель демонстрирует высокую точность в следующих сценариях:
- AI-агенты и Function Calling — минимальный процент галлюцинаций и четкое следование контексту.
- Корпоративный поиск RAG — минимальный процент галлюцинаций и четкое следование контексту.
- Обработка заказов — минимальный процент галлюцинаций и четкое следование контексту.
- Интеграция с CRM — минимальный процент галлюцинаций и четкое следование контексту.
Особенности квантования и потребления памяти
В квантовании Q4_K_M требует 14.5 ГБ VRAM, что оставляет в 24-гигабайтной карте еще почти 10 ГБ под большой контекст и параллельные запросы пользователей.
Оценка скорости генерации
50–70 т/с на RTX 4090 24GB. Обратите внимание, что скорость зависит не только от вычислительных ядер CUDA, но и в первую очередь от пропускной способности шины памяти (Memory Bandwidth). Именно поэтому видеокарты с быстрой памятью GDDR6X (RTX 4090) или HBM2e/HBM3 (A100/H100) генерируют токены в разы быстрее серверов на обычной DDR4/DDR5 памяти.
Инструкция по быстрому запуску на сервере
Самый быстрый и надежный способ запустить Mistral Small 24B (NeMo / 24B) на арендованном сервере — использовать бесплатный движок Ollama:
curl -fsSL https://ollama.com/install.sh | shollama run mistral-small:24bcurl http://localhost:11434/api/generate -d '{"model":"mistral-small:24b","prompt":"Привет! Назови 3 главных плюса сервера на NVMe"}'