Сервер под PIX Operator
в вашем контуре

Подбор конфигурации, когда языковая модель работает локально и данные 1С не покидают периметр. Размер сервера определяют три фактора — модель, нагрузка и длина контекста. Ниже — как это устроено, типовые сценарии и калькулятор под ваш профиль.

Что определяет железо
Память GPU = вес модели (уровень + степень сжатия) + буфер на одновременную работу (KV-кэш — растёт с контекстом, числом одновременных запросов и зависит от архитектуры модели). Поэтому «сколько GPU» нельзя свести к одной цифре по числу пользователей — это всегда сочетание факторов.
Типовые сценарии — точки-ориентиры, не «уровни»
Отдел
Ассистент по 1С для отдела: вопросы к своей базе, отчёты и справки на естественном языке, чтение данных. Несколько человек, одна конфигурация.
Модель~14B / MoE 27–35B
Контекст32K – 128K
1× GPU 48–96 ГБ
RTX PRO 5000/6000 Blackwell
Подразделение
ИИ-агенты в 1С: анализ договоров и документов, аналитика по нескольким конфигурациям, автоматизация действий. Десятки людей.
Модель~70B / MoE-120B
Контекст128K – 256K
1–2× GPU 94–96 ГБ
RTX PRO 6000 Blackwell / H100 NVL
Предприятие
Сложные ИИ-агенты в 1С: много баз и пользователей, длинные цепочки действий, автоматизация на уровне всего предприятия.
МодельDeepSeek V4 Flash / Pro
Контекст256K – 1M
2× H200 141 ГБ и выше
масштабируется добавлением GPU/узлов
Калькулятор под ваш профиль

Параметры

Сотрудники с доступом к ассистенту
Степень сжатия весов: меньше байт на параметр → меньше VRAM. Q4 — стандарт для on-prem.
Доля пользователей, активных в пике (типично 10%). Память считается по одновременным запросам, а не по всем сотрудникам.
Сколько токенов модель держит в одном запросе (документы + история). Это главный множитель KV-кэша.
Резервный узел под критичную нагрузку

Рекомендуемая конфигурация

Компактная модель
1× GPU 48 ГБ
модель: ~14B / MoE 27–35B (Gemma 4 / Qwen3.6)
Память GPU (VRAM)
Нужно ~X ГБ из Y ГБ1 карта
Веса + KV-кэш
Пик (100% одновременно)
Узел
Серверов (узлов)1
GPU всего1× 48 ГБ
CPU / RAM / NVMe16–32c / 128 ГБ / 2 ТБ
Inference-движокvLLM / SGLang
Как считаем. VRAM = вес модели (в 4-bit/MXFP4/FP8 + эмбеддер) + KV-кэш. KV-кэш зависит от длины контекста и числа одновременных запросов, но уже с учётом реальных оптимизаций: FP8-квантование KV (вдвое меньше FP16), prefix-кэширование (общий системный промпт и RAG-контекст хранятся один раз, а не дублируются на каждый запрос) и архитектура внимания — у гибридных моделей (Qwen3.6 / Qwen3.5 DeltaNet, Nemotron Mamba-2, DeepSeek CSA+HCA, GLM-5.2 IndexShare) KV сжат в разы против классической плотной GQA, поэтому на длинном контексте они требуют кратно меньше памяти. Выбор модели и квантования меняет расчёт.

Это предварительная оценка (порядок числа карт и узлов), не финальная спецификация. Реальная потребность зависит от конкретной модели, квантизации и профиля нагрузки; финальную конфигурацию подтверждаем нагрузочным тестом под ваш сценарий. Цены — в коммерческом предложении отдельно.
PIX Operator · первый.Бит · Лаборатория ИИ · 2026
Опубликовано на HIXO