Безопасность ИИ
Безопасность ИИ
Arka AI относится к безопасности искусственного интеллекта как к фундаментальному требованию при предоставлении доступа к большим языковым моделям. Платформа включает несколько уровней защиты: фильтрацию входных и выходных данных, модерирование контента и политику ответственного использования. На этой странице описаны принципы, механизмы и ограничения системы безопасности Arka AI.
Принципы ответственного использования
- Прозрачность. Пользователи должны понимать, как работают модели и какие у них ограничения. Мы публикуем информацию о возможностях каждой модели понимать.
- Предотвращение вреда. Запрещено использование моделей для создания вредоносного, незаконного или откровенно опасного контента.
- Согласие и приватность. Запрещена генерация персональных данных без согласия субъекта, а также попытки обхода фильтров для извлечения чувствительной информации.
- Подотчётность. Пользователи несут ответственность за результаты, полученные с помощью моделей, включая проверку фактов перед публикацией или использованием в критических сценариях.
Фильтрация контента
Все запросы к API Arka AI проходят через систему фильтрации, которая проверяет как входящие промпты, так и генерируемые ответы. Фильтрация направлена на выявление:
- Запрещённого контента: материалы, нарушающие законодательство РФ (экстремизм, порнография с участием несовершеннолетних, пропаганда наркотиков, призывы к насилию).
- Опасного контента: инструкции по созданию оружия, вредоносного ПО, обходу систем безопасности.
- Вредоносных инструкций (jailbreak): промпты, пытающиеся обойти встроенные ограничения модели (например, запросы выдать запрещённую информацию под видом безобидного сценария).
Фильтрация работает автоматически и не требует настройки со стороны пользователя. При обнаружении нарушения API возвращает ошибку с соответствующим кодом.
Модерирование
Помимо автоматической фильтрации запросов, Arka AI предоставляет конечную точку (endpoint) API модерации, которая позволяет проверять произвольный текст на соответствие политике безопасности платформы. Конечная точка доступна через стандартное OpenAI-совместимое API модерации:
- Эндпоинт:
POST /api/v1/moderations - Возможности: проверка текста по нескольким категориям (насилие, язык вражды, сексуальный контент, самоповреждение)
- Формат ответа: категория → флаг (true/false) + числовая оценка уверенности
Используйте конечную точку модерации, если вы обрабатываете пользовательский контент и хотите дополнительно проверить его перед публикацией или дальнейшей обработкой.
Ограничения моделей
Важно понимать, что текущие LLM имеют фундаментальные ограничения в области безопасности:
- Галлюцинации. Модели могут генерировать правдоподобные, но ложные утверждения. Особенно это опасно в медицинских, юридических и финансовых сценариях — всегда проверяйте факты.
- Уязвимость к jailbreak. Несмотря на фильтрацию, злоумышленники постоянно находят новые способы обхода ограничений. Ни одна система фильтрации не даёт стопроцентной защитыётся.
- Предвзятость. Модели обучаются на данных из интернета_ которые содержат культурные и социальные предвзятости. Ответы модели могут непреднамеренно отражать эти предвзятости.
- Контекстные атаки. Длинные диалоги с постепенным смещением контекста могут привести модель к генерации нежелательного контента, который не был бы сгенерирован при прямом запросе.
Мы постоянно обновляем фильтры и отслеживаем новые техники атак, но призываем пользователей применять модели ответственно и проверять критически важные результаты.
Сообщить о проблеме
Если вы обнаружили, что модель сгенерировала опасный или вредоносный контент, или нашли способ обхода фильтров безопасности, сообщите нам. Мы рассматриваем каждое обращение и используем его для улучшения системы безопасности.
Свяжитесь с нами через страницу Контакты или напишите на safety@arka-ai.ru. Пожалуйста, приложите:
- Текст промпта, вызвавшего проблему
- Полученный ответ модели
- Название модели и дату запроса
- Описание, почему вы считаете результат проблемным
Мы подтвердим получение в течение одного рабочего дня и предоставим обновление по результатам расследования.