Требования к инфраструктуре

Требования к инфраструктуре

Актуально для версии: backend 3.5.4, frontend 3.5.3.

Что нужно для развёртывания Софтлайн Классификатора: сервер приложения, модели и данные для старта.

Сама система лёгкая. Языковые модели, модели эмбеддингов и распознавания речи работают на отдельных серверах и в поставку не входят.

Сервер приложения

Ресурс Требование
CPU 4
Оперативная память 16 ГБ
Диск до 100 ГБ
GPU Не нужна
ПО на хосте Docker Engine и Docker Compose — других зависимостей нет

Система состоит из четырёх контейнеров:

Контейнер Назначение
frontend Веб-интерфейс и шлюз /api для интеграций
backend Классификация и работа с базой знаний
PostgreSQL (pgvector) База данных приложения
Qdrant Векторное хранилище

Поиск по словам (BM25) считается внутри backend на CPU и отдельного сервера не требует.

Модели (внешние серверы, в поставку не входят)

Роль Обязательна Как подключается Пример
Генеративная LLM Да OpenAI-совместимый API или Ollama; облачная или локальная Qwen, GPT-OSS, T-lite; российские облачные сервисы — там, где провайдер даёт OpenAI-совместимый API
Эмбеддинги Да OpenAI-совместимый /v1/embeddings qwen3-embedding (по умолчанию), Qwen3-Embedding-0.6B
Реранкер Нет, повышает точность отбора vLLM Qwen3-Reranker
Распознавание речи Только для голосового ввода Whisper-совместимый API Whisper
Vision-модель Только для ввода изображений OpenAI-совместимый API или Ollama Мультимодальная LLM
Мультимодальные эмбеддинги Только для режима классификации документов vLLM Qwen3-VL-Embedding

Варианты размещения моделей

  1. Облачные модели — GPU не нужна; серверу приложения нужен сетевой доступ к API провайдера.
  2. Полностью локально — ориентир: GPU-сервер 1 × A6000 или L40.
  3. Компактный комплект на одну GPU 16 ГБ — состав ниже.

Компактный комплект на 16 ГБ

Состав Память GPU, всего
Qwen3-Embedding-0.6B + Qwen3-Reranker-0.6B + T-lite-it-2.1 в Q5_K_M ≈12–14 ГБ
Qwen3-Embedding-0.6B + Qwen3-Reranker-0.6B + Qwen3.5-9B в Q4_K_M ≈13–15 ГБ

Эмбеддинг или реранкер размера 4B требуют карту на 24 ГБ. Модели класса 27B (например, Qwen3.8-27B) и T-pro — отдельный сервер.

Производительность

Ориентир — 300 запросов в час в базовой конфигурации; система масштабируется под поток обращений.

Сеть и изоляция

  • Все компоненты системы размещаются на серверах заказчика.
  • С локальными моделями система работает без доступа в интернет: модель BM25 встроена в образ, телеметрия отключена.
  • Пользователям нужен только браузер.
  • Интеграции обращаются к шлюзу https://<FQDN>/api с API-токеном.

Что нужно для старта

  1. Описание категорий — что входит в каждую категорию, что не входит, типичные формулировки.
  2. Размеченные примеры — таблица «Текст — Категория» в Excel или CSV. Ориентир — около 100 примеров на категорию, минимум 10–20.
  3. Доступ к языковой модели — облачной или локальной.

Софтлайн Классификатор — продукт компании Softline. Актуально на сентябрь 2026 года.