Софтлайн Товарищ («Товарищ майор»). Требования к оборудованию

Софтлайн Товарищ («Товарищ майор»). Система анализа и протоколирования аудиозаписей

Требования к аппаратному обеспечению

Документ описывает, какое оборудование нужно, чтобы развернуть Софтлайн Товарищ («Товарищ майор») во внутреннем контуре организации: записи, расшифровка и протоколы не покидают инфраструктуру заказчика.

Оценка дана на одну одновременно обрабатываемую запись. Рост параллелизма потребует пропорционально больше ресурсов.


1. Блоки системы

Блок Назначение
Приложение Веб-интерфейс, очередь обработки, хранилище записей и результатов, база данных
Речевая обработка Разметка спикеров, распознавание речи, оценка тона реплик, голосовые отпечатки
Языковая модель Краткая аннотация записи и структурированный протокол

Речевая обработка (голосовые модели) занимает 16 GB видеопамяти GPU.

Языковая модель — от 16 GB видеопамяти. Этого достаточно для базового варианта. Можно поставить и более крупную модель: тогда потребуется соответственно больше видеопамяти.

Если языковую модель оставляют внешней (вне этого стенда), GPU нужен только под речевую обработку — 16 GB.


2. Варианты размещения

  • Раздельные серверы. Приложение — на обычном сервере без GPU. Речевая обработка и языковая модель — на отдельном GPU-сервере.
  • Один сервер с GPU. Все блоки на одной машине. Проще в сопровождении, выше требования к процессору, памяти и диску.

3. Раздельные серверы

Сервер приложения

Ресурс Минимум Рекомендуется
Процессор 8 ядер 8 ядер
Оперативная память 16 GB 32 GB
Диск SSD 500 GB SSD 1 TB и более — зависит от срока хранения исходников и результатов
Сеть до GPU-сервера 1 Гбит/с 1 Гбит/с и выше

На диске хранятся загруженные файлы, извлечённый звук, фрагменты по спикерам и готовые протоколы.

GPU-сервер

Ресурс Минимум Рекомендуется
Процессор 8 ядер 16 ядер
Оперативная память 64 GB 64 GB
Диск SSD 200 GB SSD 400 GB — под модели и рабочий кэш
GPU 16 GB под голосовые модели + от 16 GB под языковую Запас видеопамяти, если нужна более крупная языковая модель

Голосовые и языковые модели можно держать на одной карте с суммарным объёмом видеопамяти или разнести на две карты.


4. Один сервер с GPU

Ресурс Минимум Рекомендуется
Процессор 16 ядер 16 ядер
Оперативная память 64 GB 128 GB
Диск SSD 1 TB SSD 1 TB и более
GPU 16 GB под голосовые модели + от 16 GB под языковую Запас видеопамяти под более крупную языковую модель

5. Сводка по GPU

Назначение Видеопамять
Голосовые модели (речевая обработка) 16 GB
Языковая модель от 16 GB; можно использовать и более крупные модели — тогда объём видеопамяти выше
Оба блока на одном стенде 16 GB + от 16 GB на одной или двух картах
Только речь, язык снаружи 16 GB

Конкретные модели ускорителей не фиксируются: подходит любая карта (или пара карт) с указанным объёмом видеопамяти.


6. Программное окружение

Компонент Требование
ОС Debian 12 или Debian 13, архитектура x86_64
Docker Engine 24.0 или новее
Docker Compose v2

На сервере с GPU дополнительно нужны драйвер NVIDIA и NVIDIA Container Toolkit. Отдельный CUDA Toolkit на хосте не требуется.