Обучение текстовых моделей

Обучение текстовых моделей

Ограничение: Функция тонкой настройки моделей требует работающего inference-бэкенда. В текущей версии бэкенд недоступен — форма видна, но обучение не запускается.

Тонкая настройка текстовых (языковых) моделей позволяет адаптировать готовую LLM под ваши задачи — например, научить модель отвечать в определённом стиле, понимать специфическую терминологию вашей предметной области или генерировать структурированные ответы в JSON-формате.

Формат обучающих данных

Данные для текстового fine-tuning'а загружаются в формате JSON Lines (JSONL) — текстовый файл, где каждая строка представляет собой один обучающий пример в виде самостоятельного JSON-объекта.

Поддерживаются три формата примеров:

Chat (диалог)

{"messages": [{"role": "system", "content": "Ты — ассистент по юридическим вопросам на русском языке."}, {"role": "user", "content": "Какие документы нужны для регистрации ООО?"}, {"role": "assistant", "content": "Для регистрации ООО вам потребуются: заявление по форме Р11001..."}]}
{"messages": [...]}

Формат messages — это стандартный формат OpenAI Chat Completions. Поле role принимает значения system, user или assistant.

Prompt / Completion (запрос-ответ)

{"prompt": "Переведи на юридический английский:", "completion": "Translate into legal English:"}
{"prompt": "Составь исковое заявление о...", "completion": "В Арбитражный суд города..."}

Более простой формат для задач типа перевода, суммаризации и преобразования текстов.

Instruction / Input / Output (инструкция)

{"instruction": "Классифицируй запрос клиента по категории", "input": "Я хочу отменить подписку, потому что она слишком дорогая.", "output": "Категория: Отмена / Причина: Цена"}

Формат для задач классификации, извлечения информации и выполнения инструкций.

Пошаговая инструкция (интерфейс)

Интерфейс тонкой настройки текстовых моделей находится по адресу /{ваш_username}/dashboard/training. Вот какие шаги видны в форме:

  1. Выберите тип обучения — «Текст» (Text Generation).
  2. Выберите базовую модель из выпадающего списка. Список содержит модели из каталога, доступные для fine-tuning'а.
  3. Загрузите JSONL-файл с обучающими данными. Файл должен соответствовать одному из форматов, описанных выше.
  4. Настройте гиперпараметры:
    • Количество эпох (epochs) — сколько раз модель пройдёт по обучающему набору. Обычно от 1 до 5.
    • Learning rate — скорость обучения. Рекомендуется начинать со значения 1e-5 или 2e-5.
    • Batch size — количество примеров, обрабатываемых за один шаг (часто определяется автоматически).
  5. Укажите название для обученной модели — под этим именем она появится в ваших репозиториях.
  6. Нажмите кнопку «Запустить обучение» — в текущей версии этот шаг не выполнит фактическое обучение, так как inference-бэкенд недоступен.

Форма полностью интерактивна: вы можете заполнить все поля, выбрать модель и загрузить данные. Изменения сохраняются браузером, но серверная обработка отключена до восстановления бэкенда.

Мониторинг

При работающем бэкенде вы сможете отслеживать процесс обучения в реальном времени на той же странице дашборда: график функции потерь (loss), текущая эпоха, оставшееся время. После завершения обучения модель появится в ваших репозиториях, и вы сможете использовать её через каталог и API так же, как и любую другую модель.

Практические рекомендации

  • Начинайте с небольшого набора данных (100-200 примеров), чтобы быстро проверить качество настройки.
  • Всегда оставляйте 10-20% данных для тестирования (validation set) — не включайте их в обучающий файл.
  • Используйте системное сообщение (role: "system") для задания общего тона и правил поведения модели.
  • Для обучения на русскоязычных данных выбирайте модели, которые уже хорошо понимают русский язык (DeepSeek, Qwen, GLM).