Enterprise
Przegląd
Zwykle odpowiedź AI trafia prosto do odwiedzającego. Z włączonym klasyfikatorem drugi, niezależny model najpierw czyta każdą odpowiedź i decyduje, czy można ją bezpiecznie wysłać: czy bota podstępem wyprowadzono z roli, czy udziela regulowanych porad, czy podejmuje temat, którego zakazano? Oznaczona odpowiedź nigdy nie dociera do odwiedzającego w pierwotnej formie — jest raz przepisywana, a jeśli przepisanie nadal jest oznaczone, pojawia się Twoja wiadomość zastępcza.
Jak to działa
- AI odpowiada jak zwykle - w głównym modelu nic się nie zmienia
- Klasyfikator czyta szkic - szybki drugi model sprawdza go według włączonych kategorii
- Oznaczone odpowiedzi dostają jedno przepisanie - naruszenie wraca do głównego modelu, który pisze poprawioną odpowiedź, sprawdzaną ponownie
- Zastępcza w ostateczności - jeśli przepisanie nadal jest oznaczone, odwiedzający widzi Twoją bezpieczną wiadomość zastępczą
Szkic odpowiedzi
Oznaczona
Odwiedzający widzi
Poprawiona odpowiedź
Co jest sprawdzane
- Złamania roli i prompt injection - zawsze aktywne: bot wykonuje instrukcje ukryte w wiadomości, ujawnia własne zasady lub porzuca rolę wsparcia
- Porady medyczne - diagnoza, leczenie lub dawkowanie; informacje o produktach pozostają dozwolone
- Porady prawne - interpretowanie prawa dla sytuacji odwiedzającego; przedstawianie własnych zasad pozostaje dozwolone
- Porady finansowe - rekomendacje inwestycyjne lub finansów osobistych; Twoje własne ceny i opłaty pozostają dozwolone
- Twoje tematy zakazane - dowolna lista, którą piszesz, jeden temat na linię — tutaj określasz, co jest wrażliwe dla Twojego biznesu
Dziennik incydentów
Każde oznaczenie jest zapisywane na stronie ustawień: kategoria, uzasadnienie klasyfikatora, zablokowany szkic i to, co odwiedzający zobaczył zamiast niego. To zarówno narzędzie do strojenia fałszywych alarmów, jak i ślad audytowy dla Twojego zespołu compliance. Treść incydentów przechodzi przez maskowanie PII jak każda zapisywana powierzchnia, a w trybie zerowej retencji zostają tylko metadane — żadnej treści wiadomości.
Gdy zawiedzie sam klasyfikator
Drugi model to druga rzecz, która może przekroczyć limit czasu. Ty wybierasz, co się wtedy dzieje:
- Fail-open (domyślne) - niesprawdzona odpowiedź zostaje dostarczona; wygrywa dostępność
- Fail-closed - zamiast niej pojawia się zastępcza, dla witryn, gdzie niesprawdzona odpowiedź jest gorsza niż żadna
Warto wiedzieć
- Działa tylko na odpowiedź, nigdy na pytanie - jeśli Twój bot już odmawia lub odpowiada bezpiecznie, nic nie jest oznaczane i to jest poprawne. Klasyfikator to siatka bezpieczeństwa na rzadką odpowiedź, która się prześlizgnie, a nie kontrola tego, o co zapytał odwiedzający. Próba złamania grzecznego bota zwykle nie pokaże żadnego oznaczenia, bo bot poradził sobie sam.
- Opóźnienie - sprawdzanie dodaje około pół sekundy do każdej odpowiedzi, a oznaczona odpowiedź płaci dodatkowo pełnym przepisaniem
- To nie gwarancja - to jeden model oceniający drugi; to dodatkowa niezależna warstwa, nie absolutna bariera
- Czat testowy pokazuje werdykty - czat testowy w panelu egzekwuje jak widżet na żywo i mówi, kiedy odpowiedź została oznaczona; spróbuj przechytrzyć własnego bota
- Napisz zastępczą w języku swoich odwiedzających - jest pokazywana dosłownie; wbudowana domyślna jest po angielsku
- Działa razem z instrukcjami AI - instrukcje sterują pierwszym modelem, klasyfikator łapie to, co się prześlizgnie; używaj obu
Uwaga: Klasyfikator odpowiedzi jest częścią umowy Enterprise. Napisz na [email protected], a wszystko wyjaśnimy.