TR EN RU
Техническая консультация
Нагрузка и модель GPU и VRAM Развёртывание LLM

GPU-серверы и LLM-серверы: локальная AI-инфраструктура

Мы подбираем, развёртываем и сопровождаем GPU-серверы, чтобы вы могли запускать большие языковые модели (LLM) и AI-нагрузки в собственном ЦОД.

Объём

Подбор, поставка, развёртывание и сопровождение GPU-серверов для AI-нагрузок: инференс LLM, RAG-приложения, дообучение и компьютерное зрение. Начинаем с размера модели и охватываем VRAM, архитектуру сервера, сеть, питание, охлаждение и программный слой в одном плане.

Ключевые направления

  • Расчёт VRAM и GPU по размеру модели
  • NVIDIA L4, L40S, H100, H200 и Blackwell
  • Высокопроизводительный инференс на vLLM и TensorRT-LLM
  • Векторная база данных и внутренний API для RAG
  • Планирование питания, охлаждения и стоек

Зачем локальный LLM-сервер?

Каждый запрос и документ, отправленный в публичный AI-сервис, покидает организацию. Для нагрузок с данными клиентов, договорами, исходным кодом или коммерческой тайной это может быть неприемлемо. С LLM на собственном GPU-сервере данные остаются внутри.

  • Контроль данных: запросы, документы и ответы остаются в вашей инфраструктуре; политику журналирования и хранения задаёте вы.
  • Предсказуемые затраты: при постоянной высокой загрузке стоимость единицы может быть ниже оплаты за токены.
  • Низкая задержка: модель в одной сети с внутренними системами не зависит от внешних API.
  • Адаптация: модели с открытыми весами можно адаптировать к данным компании через RAG или дообучение.

Взамен инвестиции в оборудование и эксплуатация ложатся на вас. Если нагрузка периодическая или проект на стадии пилота, разумнее начать с GPU Cloud.

Размер модели и расчёт VRAM

Первый шаг в подборе LLM-сервера — модель должна поместиться в память GPU (VRAM). Грубая оценка для весов: число параметров × байт на параметр. 2 байта в FP16/BF16, 1 байт при 8-битной квантизации, около 0,5 байта при 4-битной.

Размер моделиFP16 / BF168-bit4-bit
7–8B~16 GB~8 GB~4–5 GB
13–14B~28 GB~14 GB~7–8 GB
32–34B~64–68 GB~32–34 GB~16–18 GB
70B~140 GB~70 GB~35–40 GB

Таблица учитывает только веса модели. Больше одновременных пользователей и длиннее контекст — больше памяти под KV-кэш; на практике оставляют запас не менее 20–30%. Например, модель 70B в FP16 не помещается в один GPU на 80 ГБ и распределяется на несколько GPU.

Выбор GPU

Подходящий GPU зависит от размера модели, числа одновременных пользователей и того, нужен инференс или обучение. Распространённые GPU NVIDIA для ЦОД:

  • NVIDIA L4 (24 ГБ): небольшие модели, компьютерное зрение и видеоаналитика при низком энергопотреблении.
  • NVIDIA L40S (48 ГБ): инференс и дообучение моделей среднего размера, визуальные нагрузки.
  • NVIDIA H100 (80 ГБ): большие модели, высокопроизводительный инференс и обучение.
  • NVIDIA H200 (141 ГБ HBM3e): больше памяти для крупных моделей и длинного контекста.
  • Поколение Blackwell (B200, RTX PRO 6000 Blackwell Server Edition 96 ГБ): обучение и инференс нового поколения.

Доступность, сроки поставки и цены быстро меняются, поэтому модель GPU окончательно выбирается вместе на этапе предложения.

Архитектура сервера, сеть и питание

  • PCIe или SXM (HGX): PCIe-карты гибкие и экономичные; платформы HGX на SXM дают гораздо более высокую пропускную способность между GPU через NVLink, что важно для больших моделей.
  • CPU, RAM и хранилище: достаточно ядер CPU, системной памяти и быстрых NVMe для подготовки данных и загрузки моделей.
  • Сеть: для одного сервера может хватить 25/100 GbE; для обучения на нескольких узлах нужны InfiniBand или RoCE на 200–400 Гбит/с.
  • Питание и охлаждение: сервер с 8 GPU может потреблять около 10 кВт. Мощность стойки, охлаждение и ИБП проверяются до развёртывания.
  • Размещение: сервер можно установить в собственной серверной или в colocation.

Программный слой: инференс, RAG и мониторинг

  • Базовый слой: Linux (Ubuntu или RHEL), драйверы NVIDIA и CUDA; NVIDIA GPU Operator на Docker или Kubernetes.
  • Движок инференса: vLLM для высокой параллельности, TensorRT-LLM и Triton для максимальной производительности на NVIDIA, Ollama для небольших установок.
  • Внутренний API: OpenAI-совместимая точка доступа с аутентификацией и квотами, чтобы приложения подключались без доработок.
  • RAG: векторная база (pgvector, Qdrant, Milvus) и поиск с учётом прав доступа для подключения ваших документов к модели.
  • Разделение GPU: на GPU вроде H100 технология MIG (Multi-Instance GPU) делит один GPU на несколько изолированных экземпляров.
  • Мониторинг: NVIDIA DCGM для загрузки GPU, температуры, памяти и ошибок.

Кому подходит услуга?

Организациям, которые хотят использовать LLM без передачи данных наружу; командам, создающим внутреннего ассистента (RAG) по документам и базам знаний; R&D-подразделениям, обучающим или дообучающим свои модели; производственным и охранным компаниям с проектами компьютерного зрения.

Объём и результаты

  • Анализ нагрузки, модели и числа пользователей
  • Отчёт по расчёту VRAM, GPU и сервера
  • Предварительная проверка питания, охлаждения и сети
  • Поставка оборудования, развёртывание и программный слой
  • Тест производительности (токены/с, параллельность)
  • Эксплуатационная документация и передача

Пример сценария

Гипотетическая юридическая фирма хочет искать и резюмировать архив договоров с помощью LLM, но документы не должны покидать компанию. Квантизованная до 4 бит модель 70B работает на vLLM на сервере с двумя GPU по 48 ГБ; документы находятся через RAG с учётом прав пользователя.

Что влияет на стоимость

  • Модель и количество GPU
  • Размер модели и число пользователей
  • Платформа PCIe или HGX
  • Потребности в хранилище и сети
  • Питание, охлаждение и размещение
  • Объём ПО и поддержки

Чек-лист перед покупкой

  • Какая модель или семейство моделей, сколько параметров?
  • Сколько одновременных пользователей или запросов ожидается?
  • Только инференс или также дообучение и обучение?
  • Достаточно ли питания и охлаждения в серверной или стойке?
  • Разрешает ли лицензия открытой модели коммерческое использование?
  • Определена ли политика журналирования и хранения запросов и ответов?

Часто задаваемые вопросы

Какой GPU выбрать для LLM-сервера?

Зависит от размера модели, числа одновременных пользователей и типа нагрузки. L4 или L40S для малых и средних моделей, H100 или H200 для больших моделей и высокой производительности, платформы Blackwell для нагрузок нового поколения и самых крупных моделей.

Сколько VRAM нужно для модели 70B?

Только для весов — около 140 ГБ в FP16, 70 ГБ в 8-bit и 35–40 ГБ в 4-bit. Сверху добавляется KV-кэш для одновременных пользователей и длины контекста, поэтому оставляют запас не менее 20–30%.

Свой GPU-сервер или GPU Cloud?

При постоянной высокой загрузке и требовании хранить данные внутри собственный сервер в долгосрочной перспективе может быть выгоднее. Для пилотов, периодического обучения или неопределённого спроса GPU Cloud позволяет начать без инвестиций.

Помогает ли локальная LLM с защитой персональных данных?

Данные остаются в вашей инфраструктуре, что снижает риски трансграничной передачи и обработки третьими лицами. Права доступа, журналирование, хранение и удаление всё равно нужно проектировать вместе с техническими мерами защиты.

Какие открытые модели можно использовать?

Широко применяются семейства с открытыми весами: Llama, Qwen, Mistral, Gemma. Условия лицензий различаются; коммерческое использование и ограничения по числу пользователей проверяются до развёртывания.

RAG или дообучение?

Для ответов по документам компании обычно достаточно RAG, и при обновлении документов переобучение не требуется. Дообучение применяется, чтобы изменить стиль, формат или поведение модели в конкретной задаче.

Сколько электроэнергии потребляет GPU-сервер?

Зависит от числа и модели GPU; высокопроизводительный сервер с 8 GPU может потреблять около 10 кВт. Мощность стойки, охлаждение и ИБП планируются до развёртывания.