Рекомендуемая конфигурация
Компактная модель
1× GPU 48 ГБ
модель: ~14B / MoE 27–35B (Gemma 4 / Qwen3.6)
Память GPU (VRAM)
Нужно ~X ГБ из Y ГБ1 карта
Веса + KV-кэш
Пик (100% одновременно)
Узел
Серверов (узлов)1
GPU всего1× 48 ГБ
CPU / RAM / NVMe16–32c / 128 ГБ / 2 ТБ
Inference-движокvLLM / SGLang
Как считаем. VRAM = вес модели (в 4-bit/MXFP4/FP8 + эмбеддер) + KV-кэш. KV-кэш зависит от длины контекста и числа одновременных запросов, но уже с учётом реальных оптимизаций: FP8-квантование KV (вдвое меньше FP16), prefix-кэширование (общий системный промпт и RAG-контекст хранятся один раз, а не дублируются на каждый запрос) и архитектура внимания — у гибридных моделей (Qwen3.6 / Qwen3.5 DeltaNet, Nemotron Mamba-2, DeepSeek CSA+HCA, GLM-5.2 IndexShare) KV сжат в разы против классической плотной GQA, поэтому на длинном контексте они требуют кратно меньше памяти. Выбор модели и квантования меняет расчёт.
Это предварительная оценка (порядок числа карт и узлов), не финальная спецификация. Реальная потребность зависит от конкретной модели, квантизации и профиля нагрузки; финальную конфигурацию подтверждаем нагрузочным тестом под ваш сценарий. Цены — в коммерческом предложении отдельно.