Развёртывание на GPU
Развёртывание на GPU
Ограничение: Пути развёртывания контейнеров могут отличаться в развёртывании Arka. Инструкции ниже основаны на upstream-документации — сверьтесь с вашим администратором платформы.
Развёртывание на GPU — это процесс аренды вычислительного инстанса и запуска на нём модели или приложения. Arka AI поддерживает несколько типов вычислений, и в зависимости от вашей задачи вы можете выбрать ENDPOINT (для serving моделей), APP (для контейнерных приложений), MARKET (для аренды напрямую через маркетплейс) или TRAINING (для тонкой настройки моделей).
Общий процесс развёртывания
Чтобы развернуть модель или приложение на GPU-инстансе, выполните следующие шаги:
- Выберите тип инстанса — откройте маркетплейс на
/computeи найдите подходящую конфигурацию GPU с помощью фильтров по вендору, региону и типу инстанса. - Настройте хранилище — выберите уровень персистентного хранилища для вашего инстанса (подробнее в разделе «Настройка хранилища» ниже).
- Настройте SSH-доступ — сгенерируйте или загрузите SSH-ключ для удалённого доступа к инстансу.
- Разверните модель — после запуска инстанса загрузите модель или приложение через SSH либо через веб-интерфейс платформы.
Каждый инстанс после запуска доступен в дашборде /{ваш_namespace}/dashboard/compute/, где вы можете отслеживать его статус, смотреть логи и управлять им.
Типы развёртываемых моделей
В зависимости от задачи вы можете развернуть модель одного из следующих типов:
| Тип модели | Описание | Пример конфигурации |
|---|---|---|
| Текстовая | LLM для генерации текста | A100, 40 ГБ VRAM |
| Embeddings | Векторные представления текста | A10, 24 ГБ VRAM |
| Изображения | Stable Diffusion, ControlNet | A100, 40 ГБ VRAM |
| ASR / Речь | Распознавание и синтез речи | A10, 24 ГБ VRAM |
| OCR | Оптическое распознавание текста | T4, 16 ГБ VRAM |
Настройка хранилища
При создании инстанса вы можете выбрать уровень персистентного хранилища. Доступны следующие варианты:
| Уровень | Объём | Цена/час |
|---|---|---|
| Free | 0 ГБ | 0 |
| Small | 20 ГБ | 0.07 |
| Medium | 150 ГБ | 0.21 |
| Large | 1 ТБ | 0.99 |
Обратите внимание: уровни Small, Medium и Large в данный момент отключены (disable: true). В текущей версии доступен только уровень Free. Для enterprise-развёртывания администратор платформы может включить дополнительные уровни при необходимости.
SSH-туннель
Для удалённого доступа к вашему GPU-инстансу используется SSH-туннель. При создании инстанса вы можете:
- Сгенерировать новую пару SSH-ключей прямо в интерфейсе платформы
- Загрузить свой публичный SSH-ключ
После запуска инстанса вы получите IP-адрес и порт для подключения. Используйте стандартный SSH-клиент:
ssh -p <порт> root@<ip-адрес> -i <путь_к_приватному_ключу>
Через SSH вы можете устанавливать зависимости, загружать файлы моделей, настраивать окружение и запускать inference-сервер.
Выбор региона
Регион определяет, в каком дата-центре будет размещён ваш инстанс. При выборе учитывайте:
- Задержку (latency) — чем ближе регион к вашим пользователям, тем быстрее отклик
- Цену — цены могут различаться в зависимости от региона
- Доступность — некоторые конфигурации GPU доступны не во всех регионах
В фильтрах формы создания инстанса вы увидите список доступных регионов для выбранного вендора.
Модельная библиотека
Arka AI предоставляет библиотеку предварительно настроенных моделей, которые можно развернуть на инстансе без ручной настройки. Выберите модель из библиотеки:
- Укажите тип развёртываемой модели (текстовая, embeddings, изображения, речь, OCR)
- Выберите модель из каталога
- Система автоматически подберёт подходящую конфигурацию GPU и окружение
Использование модельной библиотеки сокращает время настройки и исключает ошибки конфигурации.