Скачивание датасета

Скачивание датасета

Скачать датасет из Arka AI можно несколькими способами — от простого скачивания через браузер до клонирования через Git LFS для версионированных наборов. Выберите способ, который лучше всего подходит для вашего сценария использования.

Все публичные датасеты доступны для скачивания любым пользователем платформы. Приватные датасеты может скачать только владелец и участники организации, к которой датасет привязан.

Способы скачивания

1. Прямое скачивание из интерфейса

Самый простой способ — скачать датасет прямо со страницы его карточки:

  1. Откройте страницу датасета — перейдите в список датасетов (/{username}/datasets) и кликните по нужному.
  2. На карточке датасета нажмите кнопку «Скачать».
  3. Браузер начнёт загрузку архива со всеми файлами датасета.

Для небольших датасетов (до нескольких сотен мегабайт) этот способ наиболее удобен. Для крупных датасетов рекомендуется использовать Git LFS или API.

2. Клонирование через Git LFS

Если датасет поддерживает версионирование через Git LFS, вы можете клонировать его как Git-репозиторий:

  1. На карточке датасета найдите секцию «Клонировать» — там будет URL для git clone.
  2. Убедитесь, что у вас установлен Git LFS (git lfs install).
  3. Выполните клонирование командой:
git clone https://arka-ai.ru/datasets/{username}/{dataset-name}.git

Git LFS автоматически скачает крупные файлы и позволяет отслеживать обновления датасета со временем.

3. Скачивание через API

Для автоматизации или интеграции в скрипты используйте API:

curl -X GET "https://api.arka-ai.ru/api/datasets/{username}/{dataset-name}/download" \
  -H "Authorization: Bearer <ваш_api_ключ>"

API возвращает прямую ссылку на скачивание архива. Подробнее об аутентификации — в разделе API-ключи.

Форматы файлов

Датасеты в Arka AI могут содержать файлы в одном из следующих форматов:

ФорматТипичное применение
CSVТабличные данные, логи, метрики
JSONLДанные для тонкой настройки LLM (пары prompt/ответ)
ParquetКрупные структурированные датасеты для аналитики
TSVТабличные данные с табуляцией как разделителем
TXTТекстовые корпуса для языковых моделей
PNG/JPGИзображения для обучения моделей компьютерного зрения

Формат файлов указывается при загрузке датасета и отображается на его карточке.

On this page