RAM и VRAM ИИ-сервера: что проверить перед покупкой GPU-системы
RAM — оперативная память сервера, VRAM — память его графических ускорителей. Если у машины указано 128 ГБ RAM и 512 ГБ суммарной VRAM, это два разных ресурса. При покупке GPU-сервера для LLM выясняйте также число карт и видеопамять каждой: общий объём сам по себе не описывает способ запуска модели.

Четыре ресурса, которые нельзя смешивать
| Ресурс | Что обслуживает | Что спросить в спецификации |
|---|---|---|
| VRAM одного ускорителя | Данные и вычисления, размещённые на конкретном GPU | Модель карты, фактический объём доступной памяти |
| Суммарная VRAM | Общий ресурс нескольких карт | Количество карт, распределение модели и тип обмена |
| RAM | ОС, загрузка данных, приложения, CPU-часть задачи | Объём, тип памяти и состав модулей |
| SSD | Веса моделей, документы, индексы, журналы и копии | Ёмкость, интерфейс, состав дисков и резервирование |
Почему несколько GPU не становятся одной картой автоматически
Сервер с несколькими ускорителями требует согласованного способа распределения работы. Поддержка зависит от модели, движка и конкретного аппаратного состава. Документация vLLM по параллельному запуску описывает разные варианты размещения модели. Это основание проверить подход, а не гарантия совместимости любого сервера с vLLM.
Поэтому в КП нужно видеть не только «512 ГБ», но и состав GPU, используемый движок, версию драйвера и результат проверки выбранной модели. Если ускорители доработаны, сведения об изменениях и доступных режимах должны войти в спецификацию именно поставляемой машины.
Память нужна не только весам модели
При работе LLM память также расходуется на контекст, промежуточные данные и служебные структуры движка. Конфигурация, которая запускает короткий одиночный запрос, может вести себя иначе при длинных документах и параллельных обращениях. Сравнивать серверы полезнее на одинаковом наборе запросов, с одинаковой моделью, форматом весов и настройками.
Квантование уменьшает объём представления весов, но выбор формата связан с поддержкой движка и качеством результата. Универсальная таблица «число параметров → готовый сервер» скрывает эти условия. В запросе на подбор укажите требуемый контекст, число одновременных обращений и пример трудного документа.
Как читать обозначения AI Server Manager
В линейке AI Server Manager доступны каталожные обозначения 128, 256, 384, 512 и 1024. Используйте их для перехода к конкретной карточке и запросу спецификации. В частности, вариант 512 следует обсуждать по модели, количеству и памяти GPU, а не воспринимать как обещание запуска любой модели с любым контекстом.
Три проверки до согласования счёта
- Сверка состава. Сопоставьте обозначение карточки с ведомостью компонентов и диагностикой конкретной машины.
- Проверка запуска. Зафиксируйте модель, версию, формат весов, контекст и программный стек; убедитесь, что выбранный сценарий работает.
- Проверка нагрузки. Повторите обычные и сложные запросы с согласованной параллельностью и оцените задержку, ошибки и потребление памяти.
Сам факт загрузки модели — один этап. Для отдела нужен также понятный порядок доступа, обновления и восстановления. Практический протокол приёмки ИИ-сервера помогает зафиксировать эти требования до покупки.
Память для сканов и фотографий: важен весь путь обработки
В проекте распознавания документов отдельно учитывайте подготовку файлов, OCR, индекс поиска и модель ответа. Размер архива на SSD не равен объёму VRAM для его обработки. Если в очереди лежат тысячи фотографий, согласуйте размеры исходников, форматы, число файлов в пакете, промежуточное хранение и итоговый результат. Потребность в памяти проверяется при тех настройках, которыми будет пользоваться отдел.
Для сервера обработки изображений или генерации в выбранном пакете укажите точную модель и версию ПО, разрешение, режим вычислений и допустимое время. В документации Diffusers по памяти описаны способы распределения компонентов и выгрузки в CPU; такие настройки меняют размещение данных и могут влиять на время работы. Переносить результат одного режима на другой без теста нельзя. Зафиксируйте настройки вместе с контрольными изображениями.
Сервер для видео: VRAM не заменяет проверку кодека
Анализ кадров моделью, декодирование исходного видео и кодирование готового ролика — отдельные этапы. Для запроса на сервер видеоаналитики перечислите кодек, разрешение, частоту кадров, число потоков, длину архива и нужный результат: например, список событий с отметками времени. Проверьте, какой этап исполняется на CPU, какой на GPU и как данные проходят через накопитель и сеть.
Матрица NVIDIA Encode/Decode задаёт возможности для конкретных устройств и форматов. По одному суммарному объёму VRAM нельзя обещать аппаратное кодирование или заданное число видеопотоков. В спецификации нужны точная карта, версия драйвера и используемая библиотека; результат подтверждается на реальных файлах покупателя.
Как сравнить режимы на одной машине
- Использовать одинаковые входные файлы, модель, разрешение и параметры результата.
- Записать пик RAM и память каждого GPU, время полного задания и возникшие ошибки.
- Проверить одиночный запрос и согласованную очередь отдела; отдельно отметить первый запуск.
- Сохранить конфигурацию ПО, чтобы повторить испытание после обновления.
Такой подход помогает купить GPU-сервер под обработку фотографий или видео с понятными критериями. Увеличение памяти рассматривайте вместе с реальным ограничением теста: загрузкой модели, размером пакета, временем ответа или хранением результатов.
Вопросы перед заказом
Можно ли складывать RAM и VRAM?
Нет. Их указывают отдельно: это разные ресурсы и разные места размещения данных.
Суммарная VRAM доступна как единый блок?
Не автоматически. Нужен поддерживаемый способ распределения модели и проверка конкретного программного стека.
Если модель поместилась, сервер уже подобран?
Нужно ещё проверить рабочий контекст, одновременную нагрузку, задержку и качество ответа.
Достаточно ли количества параметров для выбора?
Нет. Важны формат весов, контекст, движок, аппаратная совместимость и сценарий использования.
Запросить комплектацию и предложение
Напишите модель или ссылку на карточку, задачу, требования к нагрузке и город поставки. Наличие, точный состав и условия отгрузки подтверждаются в предложении.
office@omegasolutions.ru · +7 (381) 249-00-02