Powrót do panelu

Dokumentacja

Dowiedz się, jak korzystać z Asyntai

Klasyfikator odpowiedzi

Drugi model AI sprawdza każdą odpowiedź, zanim dotrze do odwiedzającego

Przejdź do klasyfikatora odpowiedzi
Enterprise

Przegląd

Zwykle odpowiedź AI trafia prosto do odwiedzającego. Z włączonym klasyfikatorem drugi, niezależny model najpierw czyta każdą odpowiedź i decyduje, czy można ją bezpiecznie wysłać: czy bota podstępem wyprowadzono z roli, czy udziela regulowanych porad, czy podejmuje temat, którego zakazano? Oznaczona odpowiedź nigdy nie dociera do odwiedzającego w pierwotnej formie — jest raz przepisywana, a jeśli przepisanie nadal jest oznaczone, pojawia się Twoja wiadomość zastępcza.

Jak to działa

  1. AI odpowiada jak zwykle - w głównym modelu nic się nie zmienia
  2. Klasyfikator czyta szkic - szybki drugi model sprawdza go według włączonych kategorii
  3. Oznaczone odpowiedzi dostają jedno przepisanie - naruszenie wraca do głównego modelu, który pisze poprawioną odpowiedź, sprawdzaną ponownie
  4. Zastępcza w ostateczności - jeśli przepisanie nadal jest oznaczone, odwiedzający widzi Twoją bezpieczną wiadomość zastępczą
Klasyfikator odpowiedzi
Szkic odpowiedzi Oznaczona
Odwiedzający widzi Poprawiona odpowiedź

Co jest sprawdzane

  • Złamania roli i prompt injection - zawsze aktywne: bot wykonuje instrukcje ukryte w wiadomości, ujawnia własne zasady lub porzuca rolę wsparcia
  • Porady medyczne - diagnoza, leczenie lub dawkowanie; informacje o produktach pozostają dozwolone
  • Porady prawne - interpretowanie prawa dla sytuacji odwiedzającego; przedstawianie własnych zasad pozostaje dozwolone
  • Porady finansowe - rekomendacje inwestycyjne lub finansów osobistych; Twoje własne ceny i opłaty pozostają dozwolone
  • Twoje tematy zakazane - dowolna lista, którą piszesz, jeden temat na linię — tutaj określasz, co jest wrażliwe dla Twojego biznesu

Dziennik incydentów

Każde oznaczenie jest zapisywane na stronie ustawień: kategoria, uzasadnienie klasyfikatora, zablokowany szkic i to, co odwiedzający zobaczył zamiast niego. To zarówno narzędzie do strojenia fałszywych alarmów, jak i ślad audytowy dla Twojego zespołu compliance. Treść incydentów przechodzi przez maskowanie PII jak każda zapisywana powierzchnia, a w trybie zerowej retencji zostają tylko metadane — żadnej treści wiadomości.

Gdy zawiedzie sam klasyfikator

Drugi model to druga rzecz, która może przekroczyć limit czasu. Ty wybierasz, co się wtedy dzieje:

  • Fail-open (domyślne) - niesprawdzona odpowiedź zostaje dostarczona; wygrywa dostępność
  • Fail-closed - zamiast niej pojawia się zastępcza, dla witryn, gdzie niesprawdzona odpowiedź jest gorsza niż żadna

Warto wiedzieć

  • Działa tylko na odpowiedź, nigdy na pytanie - jeśli Twój bot już odmawia lub odpowiada bezpiecznie, nic nie jest oznaczane i to jest poprawne. Klasyfikator to siatka bezpieczeństwa na rzadką odpowiedź, która się prześlizgnie, a nie kontrola tego, o co zapytał odwiedzający. Próba złamania grzecznego bota zwykle nie pokaże żadnego oznaczenia, bo bot poradził sobie sam.
  • Opóźnienie - sprawdzanie dodaje około pół sekundy do każdej odpowiedzi, a oznaczona odpowiedź płaci dodatkowo pełnym przepisaniem
  • To nie gwarancja - to jeden model oceniający drugi; to dodatkowa niezależna warstwa, nie absolutna bariera
  • Czat testowy pokazuje werdykty - czat testowy w panelu egzekwuje jak widżet na żywo i mówi, kiedy odpowiedź została oznaczona; spróbuj przechytrzyć własnego bota
  • Napisz zastępczą w języku swoich odwiedzających - jest pokazywana dosłownie; wbudowana domyślna jest po angielsku
  • Działa razem z instrukcjami AI - instrukcje sterują pierwszym modelem, klasyfikator łapie to, co się prześlizgnie; używaj obu

Łączy się z maskowaniem PII: jedna funkcja kontroluje, co jest zapisywane, druga — co jest mówione.

Maskowanie PII Dane osobowe są maskowane, zanim wiadomość zostanie gdziekolwiek zapisana

Uwaga: Klasyfikator odpowiedzi jest częścią umowy Enterprise. Napisz na [email protected], a wszystko wyjaśnimy.