Vállalati
Áttekintés
Normál esetben az MI válasza egyenesen a látogatóhoz megy. Bekapcsolt osztályozóval egy második, független modell először elolvas minden választ, és eldönti, biztonságos-e elküldeni: rávették-e a botot, hogy kilépjen a szerepéből, szabályozott tanácsot ad-e, tiltott témába megy-e bele? Egy megjelölt válasz soha nem jut el a látogatóhoz úgy, ahogy van — egyszer újraírjuk, és ha az újraírás is jelölést kap, a tartalék üzenete jelenik meg helyette.
Hogyan működik
- Az MI a szokásos módon válaszol - a fő modellben semmi sem változik
- Az osztályozó elolvassa a vázlatot - egy gyors második modell ellenőrzi a bekapcsolt kategóriák szerint
- A megjelölt válaszok egy újraírást kapnak - a szabálysértés visszakerül a fő modellhez, amely javított választ ír, amit újra ellenőrzünk
- A tartalék a végső eszköz - ha az újraírás is jelölést kap, a látogató a biztonságos tartalék üzenetét látja
Válaszvázlat
Megjelölve
A látogató ezt látja
Javított válasz
Mit ellenőriz
- Szereptörés és prompt injection - mindig aktív: a bot a látogatói üzenetbe rejtett utasításokat követi, felfedi saját szabályait vagy elhagyja támogatói szerepét
- Orvosi tanács - diagnózis, kezelés vagy adagolás; a termékinformáció megengedett marad
- Jogi tanács - a törvény értelmezése a látogató helyzetére; a saját szabályzat ismertetése megengedett marad
- Pénzügyi tanács - befektetési vagy személyes pénzügyi ajánlások; a saját árak és díjak megengedettek maradnak
- Az Ön tiltott témái - egy Ön által írt szabad lista, soronként egy téma — itt határozza meg, mi érzékeny az üzlete számára
Az incidensnapló
Minden jelölés rögzül a beállítások oldalon: a kategória, az osztályozó indoklása, a blokkolt vázlat és az, amit a látogató helyette látott. Ez egyszerre a téves riasztások hangolóeszköze ÉS az auditnyom a saját megfelelőségi csapata számára. Az incidensek tartalma átmegy a PII-maszkoláson, mint minden tárolt felület, nulla megőrzés módban pedig csak a metaadatok maradnak — üzenettartalom nem.
Ha maga az osztályozó esik ki
Egy második modell egy második dolog, ami időtúllépésbe futhat. Ön dönti el, mi történik ilyenkor:
- Fail-open (alapértelmezett) - a nem ellenőrzött válasz megy ki; a rendelkezésre állás nyer
- Fail-closed - helyette a tartalék jelenik meg, olyan webhelyeknél, ahol a nem ellenőrzött válasz rosszabb, mint a semmi
Jó tudni
- Csak a válaszra hat, soha nem a kérdésre - ha a botja már elutasít vagy biztonságosan válaszol, semmi sem kap jelölést, és ez így helyes. Az osztályozó biztonsági háló a ritka válaszra, amely átcsúszik, nem pedig annak ellenőrzése, amit a látogató kérdezett. Egy jól nevelt bot feltörésének kísérlete általában nem mutat jelölést, mert a bot maga kezelte.
- Késleltetés - az ellenőrzés körülbelül fél másodpercet ad minden válaszhoz, a megjelölt válasz pedig ráadásul egy teljes újraírást fizet
- Nem garancia - egy modell ítél meg egy másikat; ez egy további független réteg, nem abszolút korlát
- A tesztcsevegés mutatja az ítéleteket - az irányítópult tesztcsevegése úgy érvényesít, mint az élő widget, és szól, ha egy válasz jelölést kapott; nyugodtan próbálja átverni a saját botját
- Írja a tartalékot a látogatói nyelvén - szó szerint jelenik meg; a beépített alapértelmezett angol
- Együttműködik az MI-utasításaival - az utasítások az első modellt terelik, az osztályozó elkapja, ami átcsúszik; használja mindkettőt
Megjegyzés: A Válaszosztályozó az Enterprise megállapodás része. Írjon a [email protected] címre, és mindent elmagyarázunk.