Enterprise
Обзор
Обычно ответ ИИ идёт прямо посетителю. С включённым классификатором вторая, независимая модель сначала читает каждый ответ и решает, безопасно ли его отправлять: не обманули ли бота, заставив выйти из роли, не даёт ли он регулируемых советов, не затрагивает ли запрещённую вами тему? Помеченный ответ никогда не доходит до посетителя как есть — он один раз переписывается, и если переписанный вариант тоже помечен, показывается ваше запасное сообщение.
Как это работает
- ИИ отвечает как обычно - в основной модели ничего не меняется
- Классификатор читает черновик - быстрая вторая модель проверяет его по включённым категориям
- Помеченные ответы переписываются один раз - нарушение возвращается основной модели, которая пишет исправленный ответ, проверяемый снова
- Запасное сообщение как крайняя мера - если переписанный вариант тоже помечен, посетитель видит ваше безопасное запасное сообщение
Черновик ответа
Помечен
Посетитель видит
Исправленный ответ
Что проверяется
- Выход из роли и prompt injection - всегда активно: бот выполняет скрытые в сообщении инструкции, раскрывает собственные правила или покидает роль поддержки
- Медицинские советы - диагнозы, лечение или дозировки; информация о товарах остаётся разрешённой
- Юридические советы - трактовка закона для ситуации посетителя; излагать собственные правила по-прежнему можно
- Финансовые советы - инвестиционные или личные финансовые рекомендации; ваши собственные цены и тарифы остаются разрешёнными
- Ваши запретные темы - свободный список, который пишете вы, по одной теме на строку — здесь вы определяете, что чувствительно для вашего бизнеса
Журнал инцидентов
Каждая пометка записывается на странице настроек: категория, обоснование классификатора, заблокированный черновик и то, что посетитель увидел вместо него. Это и ваш инструмент настройки ложных срабатываний, И аудиторский след для вашей команды комплаенса. Содержимое инцидентов проходит маскирование PII, как любая сохраняемая поверхность, а в режиме нулевого хранения остаются только метаданные — никакого содержимого сообщений.
Если сам классификатор даёт сбой
Вторая модель — это вторая вещь, у которой может истечь время. Вы выбираете, что происходит тогда:
- Fail-open (по умолчанию) - доставляется непроверенный ответ; побеждает доступность
- Fail-closed - вместо него показывается запасной, для сайтов, где непроверенный ответ хуже, чем никакой
Полезно знать
- Действует только на ответ, а не на вопрос - если ваш бот уже отказывает или отвечает безопасно, ничего не помечается, и это правильно. Классификатор — это страховочная сеть для редкого ответа, который проскользнул, а не проверка того, о чём спросил посетитель. Попытка взломать хорошо ведущего себя бота обычно не покажет пометку, потому что бот справился сам.
- Задержка - проверка добавляет каждому ответу примерно полсекунды, а помеченный ответ дополнительно оплачивается полным переписыванием
- Не гарантия - одна модель оценивает другую; это дополнительный независимый слой, а не абсолютный барьер
- Тестовый чат показывает вердикты - тестовый чат в панели применяет проверку как живой виджет и сообщает, когда ответ был помечен; попробуйте перехитрить собственного бота
- Пишите запасное сообщение на языке ваших посетителей - оно показывается дословно; встроенное стандартное — на английском
- Работает вместе с вашими инструкциями ИИ - инструкции направляют первую модель, классификатор ловит то, что проскользнуло; используйте оба
Примечание: Классификатор ответов входит в соглашение Enterprise. Напишите на [email protected], и мы всё подробно объясним.