Развёртывание на GPU

Развёртывание на GPU

Ограничение: Пути развёртывания контейнеров могут отличаться в развёртывании Arka. Инструкции ниже основаны на upstream-документации — сверьтесь с вашим администратором платформы.

Развёртывание на GPU — это процесс аренды вычислительного инстанса и запуска на нём модели или приложения. Arka AI поддерживает несколько типов вычислений, и в зависимости от вашей задачи вы можете выбрать ENDPOINT (для serving моделей), APP (для контейнерных приложений), MARKET (для аренды напрямую через маркетплейс) или TRAINING (для тонкой настройки моделей).

Общий процесс развёртывания

Чтобы развернуть модель или приложение на GPU-инстансе, выполните следующие шаги:

  1. Выберите тип инстанса — откройте маркетплейс на /compute и найдите подходящую конфигурацию GPU с помощью фильтров по вендору, региону и типу инстанса.
  2. Настройте хранилище — выберите уровень персистентного хранилища для вашего инстанса (подробнее в разделе «Настройка хранилища» ниже).
  3. Настройте SSH-доступ — сгенерируйте или загрузите SSH-ключ для удалённого доступа к инстансу.
  4. Разверните модель — после запуска инстанса загрузите модель или приложение через SSH либо через веб-интерфейс платформы.

Каждый инстанс после запуска доступен в дашборде /{ваш_namespace}/dashboard/compute/, где вы можете отслеживать его статус, смотреть логи и управлять им.

Форма создания нового GPU-инстанса

Типы развёртываемых моделей

В зависимости от задачи вы можете развернуть модель одного из следующих типов:

Тип моделиОписаниеПример конфигурации
ТекстоваяLLM для генерации текстаA100, 40 ГБ VRAM
EmbeddingsВекторные представления текстаA10, 24 ГБ VRAM
ИзображенияStable Diffusion, ControlNetA100, 40 ГБ VRAM
ASR / РечьРаспознавание и синтез речиA10, 24 ГБ VRAM
OCRОптическое распознавание текстаT4, 16 ГБ VRAM

Настройка хранилища

При создании инстанса вы можете выбрать уровень персистентного хранилища. Доступны следующие варианты:

УровеньОбъёмЦена/час
Free0 ГБ0
Small20 ГБ0.07
Medium150 ГБ0.21
Large1 ТБ0.99

Обратите внимание: уровни Small, Medium и Large в данный момент отключены (disable: true). В текущей версии доступен только уровень Free. Для enterprise-развёртывания администратор платформы может включить дополнительные уровни при необходимости.

SSH-туннель

Для удалённого доступа к вашему GPU-инстансу используется SSH-туннель. При создании инстанса вы можете:

  • Сгенерировать новую пару SSH-ключей прямо в интерфейсе платформы
  • Загрузить свой публичный SSH-ключ

После запуска инстанса вы получите IP-адрес и порт для подключения. Используйте стандартный SSH-клиент:

ssh -p <порт> root@<ip-адрес> -i <путь_к_приватному_ключу>

Через SSH вы можете устанавливать зависимости, загружать файлы моделей, настраивать окружение и запускать inference-сервер.

Выбор региона

Регион определяет, в каком дата-центре будет размещён ваш инстанс. При выборе учитывайте:

  • Задержку (latency) — чем ближе регион к вашим пользователям, тем быстрее отклик
  • Цену — цены могут различаться в зависимости от региона
  • Доступность — некоторые конфигурации GPU доступны не во всех регионах

В фильтрах формы создания инстанса вы увидите список доступных регионов для выбранного вендора.

Модельная библиотека

Arka AI предоставляет библиотеку предварительно настроенных моделей, которые можно развернуть на инстансе без ручной настройки. Выберите модель из библиотеки:

  • Укажите тип развёртываемой модели (текстовая, embeddings, изображения, речь, OCR)
  • Выберите модель из каталога
  • Система автоматически подберёт подходящую конфигурацию GPU и окружение

Использование модельной библиотеки сокращает время настройки и исключает ошибки конфигурации.

On this page