Хаб / Стенд CIPHER

Стенд CIPHER

CIPHER — это песочница, стенд и место, где ломают конфигурации до того, как их увидит заказчик. Любая фраза «у нас работает» на основном сайте означает «работает вот на этой машине».

Состояние
В строю
срез от 13.08.2026
Видеокарта
RTX 4060 Ti · 16 ГБ
одна карта на модель, STT и TTS
Процессор
Ryzen 9 PRO 3900
24 потока
Оперативная память
32 ГБ
индексация и загрузка архива

Конфигурация стенда и поставки

ПозицияПолигон CIPHERTier 1 · AI Core (поставка)
ПроцессорAMD Ryzen 9 PRO 3900, 24 потокаRyzen 9 PRO 3900 или аналогичный
Оперативная память32 ГБ32 ГБ
ВидеокартаNVIDIA RTX 4060 Ti, 16 ГБNVIDIA RTX 5060 Ti, 16 ГБ
НакопительNVMe 256 ГБNVMe 1 ТБ
Операционная системаDebian 13 (trixie), ядро 6.12Debian 13 (trixie), ядро 6.12
ДрайверNVIDIA 550.163.01 · CUDA 12.4NVIDIA 550.163.01 · CUDA 12.4
КонтейнеризацияDocker 29.5.2Docker 29.5.2

Стенд намеренно скромнее поставки по накопителю: если конфигурация ведёт себя прилично на 256 ГБ NVMe, на терабайте она не станет хуже. Полный список программных компонентов — в разделе Стек и версии.

Куда уходит видеопамять

Схема планирования, а не замер: точные объёмы зависят от модели, степени квантования и длины контекста. Смысл картинки в другом — веса и голосовые модели занимают примерно одинаковое место на любой карте, а растёт с объёмом именно запас и место под длинный контекст.

16 ГБ · Tier 1 · AI Core
рабочая группа, запросы по очереди
24 ГБ · Tier 2 · AI Power
длинный контекст и параллельный голос
32 ГБ · Tier 2+ · перекрёстная проверка
две модели резидентно, без выгрузки
веса модели
контекст (KV-кэш)
распознавание и синтез речи
запас

Замеры

ПоказательЗначениеУсловия
Скорость генерации, основная модель— не опубликованоGemma 3 12B, окно 16К
Время до первого токена— не опубликованозапрос с 5 фрагментами контекста
Поиск по базе: гибрид + переранжирование— не опубликованокорпус ~10 тыс. фрагментов
Распознавание речи, реплика 15 секунд— не опубликованоokb-stt, large-v3-turbo
Синтез речи, ответ 300 символов— не опубликованоopenedai-speech, XTTS
Загрузка архива: 500 документов— не опубликованосмешанный корпус, часть через OCR
Почему здесь прочерки

Цифры производительности мы публикуем только после прогона на стенде и только вместе с условиями замера. Чужие бенчмарки и «до 40 токенов в секунду» из презентаций к вашей нагрузке отношения не имеют: результат зависит от модели, квантования, длины контекста и числа одновременных сессий. Как только очередной прогон закрыт — таблица обновляется.

Методика

Что фиксируем при замере
  • Модель, степень квантования, длину контекстного окна.
  • Число одновременных сессий и тип нагрузки — текст или голос.
  • Состав корпуса: сколько фрагментов, какая доля прошла через распознавание.
  • Версии сервисов из раздела «Стек и версии» на дату прогона.
Чего мы не делаем
  • Не показываем лучший прогон из десяти. Публикуется типовой, а не рекордный.
  • Не смешиваем замеры с разных конфигураций в одну таблицу.
  • Не переносим цифры со стенда на бокс заказчика без оговорки: другая карта — другие числа.
  • Не называем скорость «до N», когда N достигается один раз из двадцати.
Проверено на стенде · 13.08.2026
Тот же штамп стоит на странице полигона основного сайта. Он означает ровно одно: конфигурация собрана и запущена вживую, а не описана в презентации.