Обучение моделей изображений

Обучение моделей изображений

Ограничение: Функция тонкой настройки моделей требует работающего inference-бэкенда. В текущей версии бэкенд недоступен — форма видна, но обучение не запускается.

Тонкая настройка моделей генерации изображений позволяет адаптировать модель (например, Stable Diffusion или FLUX) под конкретный стиль, персонажа, объект или эстетику. Это полезно для создания генератора изображений в фирменном стиле, для арт-проектов с уникальной визуальной идентичностью или для автоматизации дизайн-задач с заданными визуальными шаблонами.

Формат обучающих данных

Для тонкой настройки моделей изображений данные готовятся в виде пар «изображение + текстовое описание» (image-caption pairs). Изображения и подписи к ним упаковываются в один архив (ZIP или TAR).

Требования к изображениям

  • Форматы: PNG, JPEG, WebP.
  • Разрешение: от 512x512 до 1024x1024 пикселей (стандартные размеры для Stable Diffusion и FLUX).
  • Количество: от 20 до нескольких сотен изображений. Качество важнее количества.

Требования к подписям

  • Каждое изображение сопровождается текстовым описанием на русском или английском языке.
  • Описание должно быть детальным: указывайте объекты, фон, освещение, стиль, композицию, цветовую гамму.
  • Пример хорошей подписи: «Девушка с тёмными волосами в профиль, освещённая закатным солнцем слева, на фоне городского парка с жёлтыми листьями. Стиль: импрессионизм, мазки кистью, мягкие переходы цвета. Формат: портрет 3:4.»
  • Пример плохой подписи: «Девушка в парке» (недостаточно деталей, модель не сможет выучить стиль).

Структура архива

Папка внутри архива должна содержать изображения и файл metadata.jsonl, где каждая строка связывает изображение с подписью:

{"file_name": "img_001.png", "text": "Девушка с тёмными волосами в профиль..."}
{"file_name": "img_002.png", "text": "Городская улица ночью в стиле киберпанк..."}

Пошаговая инструкция (интерфейс)

Интерфейс обучения моделей изображений доступен через ту же точку входа /{ваш_username}/dashboard/training, что и текстовое обучение, но с выбором соответствующего типа.

  1. Выберите тип обучения — «Изображение» (Image Generation).
  2. Выберите базовую модель (например, SDXL Turbo, FLUX.1-dev или другую модель генерации изображений из каталога).
  3. Загрузите ZIP- или TAR-архив с изображениями и файлом metadata.jsonl.
  4. Настройте гиперпараметры:
    • Количество шагов обучения (training steps) — аналог эпох в текстовом обучении. Обычно от 500 до 4000 шагов.
    • Learning rate — рекомендуется начинать со значения 1e-5.
    • Приоритет текста/изображения (text/image ratio) — баланс между следованием текстовому описанию и сохранением визуальной идентичности. Настраивается редко; обычно используется значение по умолчанию.
  5. Укажите название для обученной модели.
  6. Нажмите «Запустить обучение» — в текущей версии этот шаг не выполнит фактическое обучение.

Типичные сценарии использования

  • Обучение на своём стиле: загрузите 30-50 изображений в едином художественном стиле (ваши работы, работы конкретного художника с разрешением), и модель научится генерировать новые изображения в этом стиле.
  • Обучение на персонаже: загрузите 20-30 изображений конкретного персонажа с разных ракурсов и в разном окружении, чтобы модель могла генерировать новые сцены с этим персонажем.
  • Обучение на продукте: загрузите изображения продукта на разных фонах — модель сможет генерировать новые маркетинговые визуализации с этим продуктом в заданном контексте.

Практические рекомендации

  • Используйте разнообразные изображения: разные ракурсы, освещение, окружение — это помогает модели обобщать, а не запоминать обучающие примеры.
  • Для первого эксперимента начните с 20-30 изображений и 1000 шагов обучения.
  • Следите за переобучением: если модель генерирует только точные копии ваших обучающих изображений, значит, нужно уменьшить количество шагов или learning rate.
  • После завершения обучения модель появится в ваших репозиториях с пометкой «fine-tuned». Вы сможете генерировать изображения через API и чат-интерфейс.