Корпоративний
Огляд
Зазвичай відповідь ШІ йде прямо відвідувачу. З увімкненим класифікатором друга, незалежна модель спершу читає кожну відповідь і вирішує, чи безпечно її надсилати: чи не обманули бота, змусивши вийти з ролі, чи не дає він регульованих порад, чи не торкається забороненої вами теми? Позначена відповідь ніколи не доходить до відвідувача як є — вона один раз переписується, і якщо переписаний варіант теж позначено, показується ваше запасне повідомлення.
Як це працює
- ШІ відповідає як зазвичай - в основній моделі нічого не змінюється
- Класифікатор читає чернетку - швидка друга модель перевіряє її за увімкненими категоріями
- Позначені відповіді переписуються один раз - порушення повертається основній моделі, яка пише виправлену відповідь, що перевіряється знову
- Запасне повідомлення як крайній захід - якщо переписаний варіант теж позначено, відвідувач бачить ваше безпечне запасне повідомлення
Чернетка відповіді
Позначено
Відвідувач бачить
Виправлена відповідь
Що перевіряється
- Вихід із ролі та prompt injection - завжди активно: бот виконує приховані в повідомленні інструкції, розкриває власні правила або залишає роль підтримки
- Медичні поради - діагнози, лікування або дозування; інформація про товари залишається дозволеною
- Юридичні поради - тлумачення закону для ситуації відвідувача; викладати власні правила можна й далі
- Фінансові поради - інвестиційні або особисті фінансові рекомендації; ваші власні ціни й тарифи залишаються дозволеними
- Ваші заборонені теми - вільний список, який пишете ви, по одній темі на рядок — тут ви визначаєте, що чутливе для вашого бізнесу
Журнал інцидентів
Кожна позначка записується на сторінці налаштувань: категорія, обґрунтування класифікатора, заблокована чернетка й те, що відвідувач побачив натомість. Це і ваш інструмент налаштування хибних спрацювань, І аудиторський слід для вашої команди комплаєнсу. Вміст інцидентів проходить маскування PII, як будь-яка збережувана поверхня, а в режимі нульового зберігання залишаються лише метадані — жодного вмісту повідомлень.
Якщо сам класифікатор дає збій
Друга модель — це друга річ, у якої може сплисти час. Ви обираєте, що відбувається тоді:
- Fail-open (за замовчуванням) - доставляється неперевірена відповідь; перемагає доступність
- Fail-closed - натомість показується запасне, для сайтів, де неперевірена відповідь гірша, ніж жодна
Корисно знати
- Діє лише на відповідь, ніколи на запитання - якщо ваш бот уже відмовляє або відповідає безпечно, нічого не позначається, і це правильно. Класифікатор — це страхувальна сітка для рідкісної відповіді, що прослизнула, а не перевірка того, про що запитав відвідувач. Спроба зламати добре вихованого бота зазвичай не покаже позначки, бо бот упорався сам.
- Затримка - перевірка додає кожній відповіді приблизно пів секунди, а позначена відповідь додатково оплачується повним переписуванням
- Не гарантія - одна модель оцінює іншу; це додатковий незалежний шар, а не абсолютний барʼєр
- Тестовий чат показує вердикти - тестовий чат у панелі застосовує перевірку як живий віджет і повідомляє, коли відповідь позначено; спробуйте перехитрити власного бота
- Пишіть запасне повідомлення мовою ваших відвідувачів - воно показується дослівно; вбудоване стандартне — англійською
- Працює разом із вашими інструкціями ШІ - інструкції спрямовують першу модель, класифікатор ловить те, що прослизнуло; використовуйте обидва
Примітка: Класифікатор відповідей входить до угоди Enterprise. Напишіть на [email protected], і ми все детально пояснимо.