Корпоративен
Преглед
Обикновено отговорът на ИИ отива право при посетителя. С включен класификатор втори, независим модел първо чете всеки отговор и решава дали е безопасно да се изпрати: подмамен ли е ботът да излезе от ролята си, дава ли регулирани съвети, засяга ли тема, която сте забранили? Маркиран отговор никога не стига до посетителя такъв, какъвто е — пренаписва се веднъж, а ако и пренаписаният е маркиран, се показва вашето резервно съобщение.
Как работи
- ИИ отговаря както обикновено - нищо в основния модел не се променя
- Класификаторът чете черновата - бърз втори модел я проверява по включените категории
- Маркираните отговори получават едно пренаписване - нарушението се връща на основния модел, който пише поправен отговор, проверяван отново
- Резервното като последна мярка - ако и пренаписаният е маркиран, посетителят вижда вашето безопасно резервно съобщение
Чернова на отговор
Маркиран
Посетителят вижда
Поправен отговор
Какво се проверява
- Излизане от ролята и prompt injection - винаги активно: ботът изпълнява скрити в съобщение инструкции, разкрива собствените си правила или изоставя ролята си на поддръжка
- Медицински съвети - диагноза, лечение или дозировка; информацията за продукти остава позволена
- Правни съвети - тълкуване на закона за ситуацията на посетителя; излагането на собствените ви политики остава позволено
- Финансови съвети - инвестиционни или лични финансови препоръки; вашите собствени цени и такси остават позволени
- Вашите забранени теми - свободен списък, който пишете вие, по една тема на ред — тук определяте кое е чувствително за вашия бизнес
Дневникът на инцидентите
Всяко маркиране се записва на страницата с настройки: категорията, обосновката на класификатора, блокираната чернова и това, което посетителят е видял вместо нея. Това е и вашият инструмент за настройка на фалшивите аларми, И одитната следа за вашия екип по съответствие. Съдържанието на инцидентите минава през маскирането на PII като всяка записвана повърхност, а в режим на нулево съхранение остават само метаданните — никакво съдържание на съобщения.
Ако самият класификатор се провали
Втори модел означава второ нещо, което може да изтече по време. Вие избирате какво става тогава:
- Fail-open (по подразбиране) - доставя се непроверения отговор; печели наличността
- Fail-closed - вместо него се показва резервното, за сайтове, където непроверен отговор е по-лош от никакъв
Добре е да знаете
- Действа само върху отговора, никога върху въпроса - ако вашият бот вече отказва или отговаря безопасно, нищо не се маркира и това е правилно. Класификаторът е предпазна мрежа за рядкия отговор, който се промъква, а не проверка на това, което посетителят е попитал. Опитът да надхитрите добре възпитан бот обикновено няма да покаже маркиране, защото ботът се е справил сам.
- Закъснение - проверката добавя около половин секунда към всеки отговор, а маркиран отговор плаща допълнително с пълно пренаписване
- Не е гаранция - един модел оценява друг; това е допълнителен независим слой, не абсолютна бариера
- Тестовият чат показва присъди - тестовият чат в таблото прилага проверката като живия уиджет и ви казва кога отговор е бил маркиран; опитайте да надхитрите собствения си бот
- Напишете резервното на езика на вашите посетители - показва се дословно; вграденото стандартно е на английски
- Работи заедно с вашите ИИ инструкции - инструкциите насочват първия модел, класификаторът хваща каквото се изплъзне; използвайте и двете
Забележка: Класификаторът на отговорите е част от споразумение Enterprise. Пишете на [email protected] и ще ви обясним всичко.