Enterprise
Přehled
Normálně jde odpověď AI rovnou k návštěvníkovi. Se zapnutým klasifikátorem si každou odpověď nejdřív přečte druhý, nezávislý model a rozhodne, zda je bezpečné ji odeslat: nechal se bot vylákat z role, dává regulované rady, pouští se do tématu, které jste zakázali? Označená odpověď se k návštěvníkovi nikdy nedostane tak, jak je — jednou se přepíše, a pokud je označen i přepis, zobrazí se vaše náhradní zpráva.
Jak to funguje
- AI odpovídá jako obvykle - na hlavním modelu se nic nemění
- Klasifikátor čte koncept - rychlý druhý model ho kontroluje podle zapnutých kategorií
- Označené odpovědi dostanou jeden přepis - porušení se vrátí hlavnímu modelu, který napíše opravenou odpověď, jež se kontroluje znovu
- Náhradní zpráva jako poslední možnost - je-li označen i přepis, návštěvník uvidí vaši bezpečnou náhradní zprávu
Koncept odpovědi
Označena
Návštěvník vidí
Opravená odpověď
Co se kontroluje
- Porušení role a prompt injection - vždy aktivní: bot plní instrukce skryté ve zprávě, prozrazuje vlastní pravidla nebo opouští roli podpory
- Lékařské rady - diagnóza, léčba nebo dávkování; informace o produktech zůstávají povoleny
- Právní rady - výklad práva pro situaci návštěvníka; uvádět vlastní zásady zůstává povoleno
- Finanční rady - investiční doporučení nebo osobní finance; vaše vlastní ceny a poplatky zůstávají povoleny
- Vaše zakázaná témata - volný seznam, který píšete vy, jedno téma na řádek — tady určujete, co je pro váš byznys citlivé
Protokol incidentů
Každé označení se zaznamenává na stránce nastavení: kategorie, zdůvodnění klasifikátoru, zablokovaný koncept a to, co návštěvník viděl místo něj. Je to váš nástroj pro ladění falešných poplachů I auditní stopa pro váš compliance tým. Obsah incidentů prochází maskováním PII jako každý ukládaný povrch a v režimu nulového uchovávání zůstávají jen metadata — žádný obsah zpráv.
Když selže sám klasifikátor
Druhý model je druhá věc, které může vypršet čas. Vy volíte, co se pak stane:
- Fail-open (výchozí) - doručí se nezkontrolovaná odpověď; vyhrává dostupnost
- Fail-closed - místo ní se zobrazí náhradní, pro weby, kde je nezkontrolovaná odpověď horší než žádná
Dobré vědět
- Reaguje jen na odpověď, nikdy na otázku - pokud váš bot už odmítá nebo odpovídá bezpečně, nic se neoznačí a to je správně. Klasifikátor je záchranná síť pro vzácnou odpověď, která proklouzne, ne kontrola toho, na co se návštěvník zeptal. Pokus obelstít slušně vychovaného bota obvykle neukáže žádné označení, protože si to bot vyřídil sám.
- Latence - kontrola přidává každé odpovědi zhruba půl sekundy a označená odpověď platí navíc celým přepisem
- Není to záruka - jeden model posuzuje druhý; je to další nezávislá vrstva, ne absolutní bariéra
- Testovací chat ukazuje verdikty - testovací chat v přehledu vynucuje jako živý widget a řekne vám, kdy byla odpověď označena; klidně zkuste přelstít vlastního bota
- Náhradní zprávu napište v jazyce svých návštěvníků - zobrazuje se doslova; vestavěná výchozí je anglicky
- Funguje spolu s vašimi instrukcemi AI - instrukce řídí první model, klasifikátor chytá, co proklouzne; používejte obojí
Poznámka: Klasifikátor odpovědí je součástí smlouvy Enterprise. Napište na [email protected] a vše vám vysvětlíme.