Стенд CIPHER
CIPHER — это песочница, стенд и место, где ломают конфигурации до того, как их увидит заказчик. Любая фраза «у нас работает» на основном сайте означает «работает вот на этой машине».
Конфигурация стенда и поставки
| Позиция | Полигон CIPHER | Tier 1 · AI Core (поставка) |
|---|---|---|
| Процессор | AMD Ryzen 9 PRO 3900, 24 потока | Ryzen 9 PRO 3900 или аналогичный |
| Оперативная память | 32 ГБ | 32 ГБ |
| Видеокарта | NVIDIA RTX 4060 Ti, 16 ГБ | NVIDIA RTX 5060 Ti, 16 ГБ |
| Накопитель | NVMe 256 ГБ | NVMe 1 ТБ |
| Операционная система | Debian 13 (trixie), ядро 6.12 | Debian 13 (trixie), ядро 6.12 |
| Драйвер | NVIDIA 550.163.01 · CUDA 12.4 | NVIDIA 550.163.01 · CUDA 12.4 |
| Контейнеризация | Docker 29.5.2 | Docker 29.5.2 |
Стенд намеренно скромнее поставки по накопителю: если конфигурация ведёт себя прилично на 256 ГБ NVMe, на терабайте она не станет хуже. Полный список программных компонентов — в разделе Стек и версии.
Куда уходит видеопамять
Схема планирования, а не замер: точные объёмы зависят от модели, степени квантования и длины контекста. Смысл картинки в другом — веса и голосовые модели занимают примерно одинаковое место на любой карте, а растёт с объёмом именно запас и место под длинный контекст.
Замеры
| Показатель | Значение | Условия |
|---|---|---|
| Скорость генерации, основная модель | — не опубликовано | Gemma 3 12B, окно 16К |
| Время до первого токена | — не опубликовано | запрос с 5 фрагментами контекста |
| Поиск по базе: гибрид + переранжирование | — не опубликовано | корпус ~10 тыс. фрагментов |
| Распознавание речи, реплика 15 секунд | — не опубликовано | okb-stt, large-v3-turbo |
| Синтез речи, ответ 300 символов | — не опубликовано | openedai-speech, XTTS |
| Загрузка архива: 500 документов | — не опубликовано | смешанный корпус, часть через OCR |
Цифры производительности мы публикуем только после прогона на стенде и только вместе с условиями замера. Чужие бенчмарки и «до 40 токенов в секунду» из презентаций к вашей нагрузке отношения не имеют: результат зависит от модели, квантования, длины контекста и числа одновременных сессий. Как только очередной прогон закрыт — таблица обновляется.
Методика
- Модель, степень квантования, длину контекстного окна.
- Число одновременных сессий и тип нагрузки — текст или голос.
- Состав корпуса: сколько фрагментов, какая доля прошла через распознавание.
- Версии сервисов из раздела «Стек и версии» на дату прогона.
- Не показываем лучший прогон из десяти. Публикуется типовой, а не рекордный.
- Не смешиваем замеры с разных конфигураций в одну таблицу.
- Не переносим цифры со стенда на бокс заказчика без оговорки: другая карта — другие числа.
- Не называем скорость «до N», когда N достигается один раз из двадцати.