При сборке бокса можно ошибиться почти в любом компоненте и починить это позже: добавить оперативной памяти, поменять диск, доложить сеть. Единственная позиция, где ошибка стоит новой карты, — объём видеопамяти. Поэтому её выбирают первой, а всё остальное подгоняют под неё.
На что тратится видеопамять
Расход складывается из четырёх частей, и только первая из них очевидна.
- Веса модели. Основная и самая предсказуемая статья. Модель на 12 миллиардов параметров в типичном квантованном виде занимает единицы гигабайт; чем выше точность квантования, тем больше и тем аккуратнее ответы.
- Контекст (KV-кэш). Растёт вместе с длиной диалога и количеством найденных фрагментов, которые мы подкладываем модели. Именно эта часть коварна: на коротких вопросах её почти не видно, на длинном разборе документа она отъедает заметный кусок.
- Голосовой контур. Распознавание и синтез держат свои модели. Они меньше языковой, но они там есть.
- Запас. Память, которую нельзя занимать. Когда её не остаётся, система не «немного замедляется» — она падает с ошибкой нехватки памяти или начинает выгружать модель на диск, что по ощущениям хуже падения.
Считать надо не «влезет ли модель», а «влезет ли модель вместе с длинным контекстом, распознаванием, синтезом и запасом». Первая арифметика даёт красивую презентацию, вторая — работающий сервер.
Как это ложится на тарифные контуры
Tier 1, он же AI Core — 16 ГБ. Текущий MVP и то, что стоит на полигоне CIPHER. Модель уровня Gemma 3 на 12 миллиардов параметров с окном 16К, гибридный поиск, умный OCR, голосовой контур. Одной карты хватает, чтобы обслуживать небольшую рабочую группу: пока запросы приходят по очереди, все три сервиса делят карту без конфликтов.
Tier 2, он же AI Power — 24–32 ГБ. Начинается там, где одновременных пользователей становится много или где нужна тяжёлая параллельная голосовая нагрузка. Запас памяти здесь тратится на две вещи: держать несколько моделей резидентно, не выгружая их по кругу, и переварить пиковую нагрузку без ошибок нехватки памяти. Здесь же живёт режим с перекрёстной проверкой ответов — про него отдельный разбор.
Tier 3, Heavy Enterprise — две и больше карт. Тяжёлые модели уровня 27B и выше, сквозные интеграции, узлы федеративного обучения. Здесь разговор уже не про «сколько гигабайт», а про то, как разложить задачи по картам.
Почему не взять сразу максимум
Потому что деньги заказчика — не абстракция, а Setup fee, который он платит один раз и сразу. Карта на 32 ГБ в боксе, где работает пятеро человек с текстовыми вопросами, — это оплаченный воздух: она будет простаивать так же, как простаивала бы карта на 16 ГБ, только дороже.
Правильная последовательность обратная: сначала понять сценарий (сколько людей, какие документы, нужен ли голос, нужен ли параллельный доступ), потом подобрать карту. Если сценарий неизвестен — а на старте он часто неизвестен честно, — разумнее начать с Tier 1 и увидеть реальную нагрузку. Железо остаётся вашей собственностью с первого дня, и апгрейд картой большего объёма — это замена одного компонента, а не новый проект.
Не только память
Видеопамять определяет, поместится ли задача. Скорость определяют другие вещи, и о них тоже стоит знать:
- Пропускная способность памяти карты — от неё напрямую зависит скорость генерации токенов.
- Процессор и оперативная память — на них ложатся индексация, распознавание документов при загрузке архива и работа хранилища.
- Диск. NVMe нужен не ради красоты: векторное хранилище и база документов живут именно там, а бэкап в 03:30 не должен пересекаться с рабочим днём.
Конкретные значения — скорость генерации, время ответа, объём базы — зависят от карты, модели, длины контекста и ваших документов настолько, что чужие замеры для вас бесполезны. Мы публикуем то, что снимаем на стенде CIPHER, и указываем конфигурацию, на которой снимали: страница стенда.
Коротко
Видеопамять расходуется на веса, контекст, голосовой контур и обязательный запас. Шестнадцати гигабайт достаточно для рабочей группы на текущем стеке — это проверено на нашем стенде. Двадцать четыре и больше нужны там, где появляется параллельная нагрузка или перекрёстная проверка ответов. Всё, что сверх сценария, — это не «на вырост», это деньги, которые лучше потратить на нормальные диски и резервное копирование.