RAM и VRAM ИИ-сервера: что проверить перед покупкой GPU-системы

RAM — оперативная память сервера, VRAM — память его графических ускорителей. Если у машины указано 128 ГБ RAM и 512 ГБ суммарной VRAM, это два разных ресурса. При покупке GPU-сервера для LLM выясняйте также число карт и видеопамять каждой: общий объём сам по себе не описывает способ запуска модели.

Серверная платформа: корпус и лицевая панель
Серверная платформа. Комплектация выбранной конфигурации указывается в спецификации. Открыть полное фото.

Четыре ресурса, которые нельзя смешивать

РесурсЧто обслуживаетЧто спросить в спецификации
VRAM одного ускорителяДанные и вычисления, размещённые на конкретном GPUМодель карты, фактический объём доступной памяти
Суммарная VRAMОбщий ресурс нескольких картКоличество карт, распределение модели и тип обмена
RAMОС, загрузка данных, приложения, CPU-часть задачиОбъём, тип памяти и состав модулей
SSDВеса моделей, документы, индексы, журналы и копииЁмкость, интерфейс, состав дисков и резервирование

Почему несколько GPU не становятся одной картой автоматически

Сервер с несколькими ускорителями требует согласованного способа распределения работы. Поддержка зависит от модели, движка и конкретного аппаратного состава. Документация vLLM по параллельному запуску описывает разные варианты размещения модели. Это основание проверить подход, а не гарантия совместимости любого сервера с vLLM.

Поэтому в КП нужно видеть не только «512 ГБ», но и состав GPU, используемый движок, версию драйвера и результат проверки выбранной модели. Если ускорители доработаны, сведения об изменениях и доступных режимах должны войти в спецификацию именно поставляемой машины.

Память нужна не только весам модели

При работе LLM память также расходуется на контекст, промежуточные данные и служебные структуры движка. Конфигурация, которая запускает короткий одиночный запрос, может вести себя иначе при длинных документах и параллельных обращениях. Сравнивать серверы полезнее на одинаковом наборе запросов, с одинаковой моделью, форматом весов и настройками.

Квантование уменьшает объём представления весов, но выбор формата связан с поддержкой движка и качеством результата. Универсальная таблица «число параметров → готовый сервер» скрывает эти условия. В запросе на подбор укажите требуемый контекст, число одновременных обращений и пример трудного документа.

Как читать обозначения AI Server Manager

В линейке AI Server Manager доступны каталожные обозначения 128, 256, 384, 512 и 1024. Используйте их для перехода к конкретной карточке и запросу спецификации. В частности, вариант 512 следует обсуждать по модели, количеству и памяти GPU, а не воспринимать как обещание запуска любой модели с любым контекстом.

Три проверки до согласования счёта

  1. Сверка состава. Сопоставьте обозначение карточки с ведомостью компонентов и диагностикой конкретной машины.
  2. Проверка запуска. Зафиксируйте модель, версию, формат весов, контекст и программный стек; убедитесь, что выбранный сценарий работает.
  3. Проверка нагрузки. Повторите обычные и сложные запросы с согласованной параллельностью и оцените задержку, ошибки и потребление памяти.

Сам факт загрузки модели — один этап. Для отдела нужен также понятный порядок доступа, обновления и восстановления. Практический протокол приёмки ИИ-сервера помогает зафиксировать эти требования до покупки.

Память для сканов и фотографий: важен весь путь обработки

В проекте распознавания документов отдельно учитывайте подготовку файлов, OCR, индекс поиска и модель ответа. Размер архива на SSD не равен объёму VRAM для его обработки. Если в очереди лежат тысячи фотографий, согласуйте размеры исходников, форматы, число файлов в пакете, промежуточное хранение и итоговый результат. Потребность в памяти проверяется при тех настройках, которыми будет пользоваться отдел.

Для сервера обработки изображений или генерации в выбранном пакете укажите точную модель и версию ПО, разрешение, режим вычислений и допустимое время. В документации Diffusers по памяти описаны способы распределения компонентов и выгрузки в CPU; такие настройки меняют размещение данных и могут влиять на время работы. Переносить результат одного режима на другой без теста нельзя. Зафиксируйте настройки вместе с контрольными изображениями.

Сервер для видео: VRAM не заменяет проверку кодека

Анализ кадров моделью, декодирование исходного видео и кодирование готового ролика — отдельные этапы. Для запроса на сервер видеоаналитики перечислите кодек, разрешение, частоту кадров, число потоков, длину архива и нужный результат: например, список событий с отметками времени. Проверьте, какой этап исполняется на CPU, какой на GPU и как данные проходят через накопитель и сеть.

Матрица NVIDIA Encode/Decode задаёт возможности для конкретных устройств и форматов. По одному суммарному объёму VRAM нельзя обещать аппаратное кодирование или заданное число видеопотоков. В спецификации нужны точная карта, версия драйвера и используемая библиотека; результат подтверждается на реальных файлах покупателя.

Как сравнить режимы на одной машине

  • Использовать одинаковые входные файлы, модель, разрешение и параметры результата.
  • Записать пик RAM и память каждого GPU, время полного задания и возникшие ошибки.
  • Проверить одиночный запрос и согласованную очередь отдела; отдельно отметить первый запуск.
  • Сохранить конфигурацию ПО, чтобы повторить испытание после обновления.

Такой подход помогает купить GPU-сервер под обработку фотографий или видео с понятными критериями. Увеличение памяти рассматривайте вместе с реальным ограничением теста: загрузкой модели, размером пакета, временем ответа или хранением результатов.

Вопросы перед заказом

Можно ли складывать RAM и VRAM?

Нет. Их указывают отдельно: это разные ресурсы и разные места размещения данных.

Суммарная VRAM доступна как единый блок?

Не автоматически. Нужен поддерживаемый способ распределения модели и проверка конкретного программного стека.

Если модель поместилась, сервер уже подобран?

Нужно ещё проверить рабочий контекст, одновременную нагрузку, задержку и качество ответа.

Достаточно ли количества параметров для выбора?

Нет. Важны формат весов, контекст, движок, аппаратная совместимость и сценарий использования.

Запросить комплектацию и предложение

Напишите модель или ссылку на карточку, задачу, требования к нагрузке и город поставки. Наличие, точный состав и условия отгрузки подтверждаются в предложении.

office@omegasolutions.ru · +7 (381) 249-00-02
Флаг России Флаг Казахстана
office@omegasolutions.ru

Все запросы только на email