Takaisin hallintapaneeliin

Dokumentaatio

Opi käyttämään Asyntai

Vastausluokitin

Toinen tekoälymalli tarkistaa jokaisen vastauksen ennen kuin se saavuttaa vierailijan

Siirry vastausluokittimeen
Enterprise

Yleiskatsaus

Normaalisti tekoälyn vastaus menee suoraan vierailijalle. Kun luokitin on päällä, toinen riippumaton malli lukee ensin jokaisen vastauksen ja päättää, onko se turvallinen lähettää: huijattiinko botti ulos roolistaan, antaako se säänneltyjä neuvoja, meneekö se kieltämääsi aiheeseen? Liputettu vastaus ei koskaan saavuta vierailijaa sellaisenaan — se kirjoitetaan kerran uudelleen, ja jos uudelleenkirjoituskin liputetaan, tilalle näytetään varaviestisi.

Miten se toimii

  1. Tekoäly vastaa kuten ennenkin - päämallissa mikään ei muutu
  2. Luokitin lukee luonnoksen - nopea toinen malli tarkistaa sen käytössä olevia kategorioita vasten
  3. Liputetut vastaukset saavat yhden uudelleenkirjoituksen - rikkomus palautetaan päämallille, joka kirjoittaa korjatun vastauksen, joka tarkistetaan uudelleen
  4. Varaviesti viimeisenä keinona - jos uudelleenkirjoituskin liputetaan, vierailija näkee turvallisen varaviestisi
Vastausluokitin
Vastausluonnos Liputettu
Vierailija näkee Korjattu vastaus

Mitä tarkistetaan

  • Roolirikkomukset ja prompt injection - aina aktiivinen: botti tottelee viestiin piilotettuja ohjeita, paljastaa omat sääntönsä tai hylkää tukiroolinsa
  • Lääketieteelliset neuvot - diagnoosi, hoito tai annostus; tuotetiedot pysyvät sallittuina
  • Lakineuvot - lain tulkinta vierailijan tilanteeseen; omien käytäntöjen kertominen pysyy sallittuna
  • Talousneuvot - sijoitus- tai henkilökohtaiset taloussuositukset; omat hinnat ja maksut pysyvät sallittuina
  • Sinun kielletyt aiheesi - vapaa lista, jonka kirjoitat itse, yksi aihe riviä kohden — tässä määrittelet, mikä on arkaluonteista liiketoiminnallesi

Tapausloki

Jokainen liputus kirjataan asetussivulle: kategoria, luokittimen perustelu, estetty luonnos ja se, mitä vierailija näki tilalle. Se on sekä työkalusi väärien hälytysten säätöön ETTÄ kirjausketju omalle compliance-tiimillesi. Tapausten sisältö kulkee PII-maskauksen läpi kuten jokainen tallennettu pinta, ja nollasäilytystilassa jäljelle jäävät vain metatiedot — ei viestisisältöä.

Jos luokitin itse pettää

Toinen malli on toinen asia, joka voi aikakatkaista. Sinä valitset, mitä silloin tapahtuu:

  • Fail-open (oletus) - tarkistamaton vastaus toimitetaan; saatavuus voittaa
  • Fail-closed - tilalle näytetään varaviesti, sivustoille joilla tarkistamaton vastaus on pahempi kuin ei vastausta

Hyvä tietää

  • Se vaikuttaa vain vastaukseen, ei koskaan kysymykseen - jos bottisi jo kieltäytyy tai vastaa turvallisesti, mitään ei liputeta, ja se on oikein. Luokitin on turvaverkko harvinaiselle vastaukselle, joka lipsahtaa läpi, ei tarkistus siitä, mitä vierailija kysyi. Hyvin käyttäytyvän botin huijaaminen ei yleensä näytä liputusta, koska botti hoiti sen itse.
  • Viive - tarkistus lisää noin puoli sekuntia jokaiseen vastaukseen, ja liputettu vastaus maksaa lisäksi kokonaisen uudelleenkirjoituksen
  • Ei takuu - yksi malli arvioi toista; se on ylimääräinen riippumaton kerros, ei ehdoton este
  • Testichat näyttää tuomiot - hallintapaneelin testichat valvoo kuten live-widget ja kertoo, kun vastaus liputettiin; yritä vaikka huijata omaa bottiasi
  • Kirjoita varaviesti vierailijoidesi kielellä - se näytetään sellaisenaan; sisäänrakennettu oletus on englanniksi
  • Toimii tekoälyohjeidesi rinnalla - ohjeet ohjaavat ensimmäistä mallia, luokitin nappaa sen, mikä lipsahtaa läpi; käytä molempia

Muodostaa parin PII-maskauksen kanssa: toinen toiminto hallitsee, mitä tallennetaan, toinen, mitä sanotaan.

PII-maskaus Henkilötiedot peitetään ennen kuin viesti tallennetaan minnekään

Huomautus: Vastausluokitin on osa Enterprise-sopimusta. Kirjoita osoitteeseen [email protected], niin käymme kaiken läpi.