Tilbake til dashbord

Dokumentasjon

Lær hvordan du bruker Asyntai

Svarklassifikator

En annen AI-modell sjekker hvert svar før det når besøkeren

Gå til svarklassifikatoren
Enterprise

Oversikt

Normalt går AI-ens svar rett til besøkeren. Med klassifikatoren på leser en annen, uavhengig modell først hvert svar og avgjør om det er trygt å sende: ble boten lurt ut av rollen sin, gir den regulerte råd, går den inn på et emne du har forbudt? Et flagget svar når aldri besøkeren slik det er — det skrives om én gang, og hvis omskrivingen også flagges, vises reservemeldingen din i stedet.

Slik fungerer det

  1. AI-en svarer som vanlig - ingenting endres i hovedmodellen
  2. Klassifikatoren leser utkastet - en rask andre modell sjekker det mot de aktiverte kategoriene dine
  3. Flaggede svar får én omskriving - bruddet sendes tilbake til hovedmodellen, som skriver et rettet svar som sjekkes på nytt
  4. Reserven som siste utvei - hvis omskrivingen også flagges, ser besøkeren den trygge reservemeldingen din
Svarklassifikator
Svarutkast Flagget
Besøkeren ser Rettet svar

Hva som sjekkes

  • Rollebrudd og prompt injection - alltid aktivt: boten adlyder skjulte instruksjoner i en melding, avslører sine egne regler eller forlater supportrollen
  • Medisinske råd - diagnose, behandling eller dosering; produktinformasjon forblir tillatt
  • Juridiske råd - å tolke loven for besøkerens situasjon; å beskrive egne retningslinjer forblir tillatt
  • Finansielle råd - investerings- eller privatøkonomiske anbefalinger; egne priser og gebyrer forblir tillatt
  • Dine forbudte emner - en fri liste du skriver selv, ett emne per linje — her definerer du hva som er sensitivt for virksomheten din

Hendelsesloggen

Hver flagging registreres på innstillingssiden: kategorien, klassifikatorens begrunnelse, det blokkerte utkastet og hva besøkeren så i stedet. Det er både verktøyet ditt for å justere falske alarmer OG revisjonssporet for ditt eget compliance-team. Hendelsesinnhold går gjennom PII-maskering som enhver lagret flate, og i Zero Retention-modus beholdes bare metadata — intet meldingsinnhold.

Hvis klassifikatoren selv svikter

En annen modell er en annen ting som kan nå tidsgrensen. Du velger hva som skjer da:

  • Fail-open (standard) - det usjekkede svaret leveres; tilgjengelighet vinner
  • Fail-closed - reserven vises i stedet, for nettsteder der et usjekket svar er verre enn ikke noe svar

Godt å vite

  • Det handler bare på svaret, aldri på spørsmålet - hvis boten din allerede avviser eller svarer trygt, flagges ingenting, og det er riktig. Klassifikatoren er et sikkerhetsnett for det sjeldne svaret som slipper gjennom, ikke en kontroll av hva den besøkende spurte om. Å prøve å lure en veloppdragen bot viser vanligvis ingen flagging, fordi boten håndterte det selv.
  • Latens - sjekken legger omtrent et halvt sekund til hvert svar, og et flagget svar betaler i tillegg en full omskriving
  • Ikke en garanti - én modell bedømmer en annen; det er et ekstra uavhengig lag, ikke en absolutt barriere
  • Testchatten viser dommer - dashbordets testchat håndhever som live-widgeten og sier fra når et svar ble flagget; prøv gjerne å lure din egen bot
  • Skriv reserven på språket til de besøkende - den vises ordrett; den innebygde standarden er på engelsk
  • Fungerer sammen med AI-instruksjonene dine - instruksjonene styrer den første modellen, klassifikatoren fanger det som slipper gjennom; bruk begge

Danner par med PII-maskering: den ene funksjonen styrer hva som lagres, den andre hva som sies.

PII-maskering Persondata maskeres før en melding lagres noe sted

Merk: Svarklassifikatoren er en del av en Enterprise-avtale. Skriv til [email protected], så går vi gjennom alt.