Terug naar dashboard

Documentatie

Leer hoe u Asyntai kunt gebruiken

Antwoordclassificatie

Een tweede AI-model controleert elk antwoord voordat het de bezoeker bereikt

Ga naar antwoordclassificatie
Enterprise

Overzicht

Normaal gaat het antwoord van de AI rechtstreeks naar de bezoeker. Met antwoordclassificatie aan leest een tweede, onafhankelijk model elk antwoord eerst en beslist of het veilig te versturen is: is de bot misleid om uit zijn rol te stappen, geeft hij gereguleerd advies, gaat hij in op een onderwerp dat u hebt verboden? Een gemarkeerd antwoord bereikt de bezoeker nooit zoals het is — het wordt één keer herschreven, en is ook de herschrijving gemarkeerd, dan verschijnt uw terugvalbericht.

Hoe het werkt

  1. De AI antwoordt zoals gewoonlijk - er verandert niets aan het hoofdmodel
  2. De classifier leest het concept - een snel tweede model toetst het aan uw ingeschakelde categorieën
  3. Gemarkeerde antwoorden krijgen één herschrijving - de overtreding gaat terug naar het hoofdmodel, dat een gecorrigeerd antwoord schrijft dat opnieuw wordt gecontroleerd
  4. Terugval als laatste redmiddel - is ook de herschrijving gemarkeerd, dan ziet de bezoeker uw veilige terugvalbericht
Antwoordclassificatie
Conceptantwoord Gemarkeerd
Bezoeker ziet Gecorrigeerd antwoord

Wat wordt gecontroleerd

  • Rolbreuken en prompt-injectie - altijd actief: de bot gehoorzaamt verborgen instructies in een bericht, onthult zijn eigen regels of laat zijn supportrol los
  • Medisch advies - diagnose, behandeling of dosering; productinformatie blijft toegestaan
  • Juridisch advies - de wet uitleggen voor de situatie van de bezoeker; uw eigen beleid benoemen blijft toegestaan
  • Financieel advies - beleggings- of persoonlijk financieel advies; uw eigen prijzen en tarieven blijven toegestaan
  • Uw verboden onderwerpen - een vrije lijst die u schrijft, één onderwerp per regel — hier bepaalt u wat gevoelig is voor uw bedrijf

Het incidentenlogboek

Elke markering wordt vastgelegd op de instellingenpagina: de categorie, de reden van de classifier, het geblokkeerde concept en wat de bezoeker in plaats daarvan zag. Het is zowel uw afstemtool voor valse positieven als het auditspoor voor uw eigen compliance-team. Incidentinhoud gaat door PII-maskering zoals elk opgeslagen oppervlak, en in Zero Retention-modus blijven alleen de metadata over — geen berichtinhoud.

Als de classifier zelf uitvalt

Een tweede model is een tweede ding dat kan uitvallen. U kiest wat er dan gebeurt:

  • Fail-open (standaard) - het ongecontroleerde antwoord wordt geleverd; beschikbaarheid wint
  • Fail-closed - in plaats daarvan verschijnt de terugval, voor sites waar een ongecontroleerd antwoord erger is dan geen antwoord

Goed om te weten

  • Het reageert alleen op het antwoord, nooit op de vraag - als uw bot al weigert of veilig antwoordt, wordt er niets gemarkeerd, en dat klopt. De classifier is een vangnet voor het zeldzame antwoord dat erdoorheen glipt, geen controle op wat de bezoeker vroeg. Proberen een braaf gedragende bot te kraken toont meestal geen markering, omdat de bot het zelf afhandelde.
  • Latentie - de controle voegt ongeveer een halve seconde toe aan elk antwoord, en een gemarkeerd antwoord betaalt daarbovenop een volledige herschrijving
  • Geen garantie - dit is het ene model dat het andere beoordeelt; het is een extra onafhankelijke laag, geen absolute barrière
  • De testchat toont oordelen - de testchat van het dashboard handhaaft zoals de live widget en vertelt u wanneer een antwoord is gemarkeerd; probeer gerust uw eigen bot te misleiden
  • Schrijf de terugval in de taal van uw bezoekers - hij wordt letterlijk getoond; de ingebouwde standaard is Engels
  • Werkt samen met uw AI-instructies - instructies sturen het eerste model, de classifier vangt af wat erdoorheen glipt; gebruik beide

Vormt een paar met PII-maskering: de ene functie bepaalt wat wordt opgeslagen, de andere wat wordt gezegd.

PII-maskering Persoonsgegevens worden gemaskeerd voordat een bericht ergens wordt opgeslagen

Opmerking: Antwoordclassificatie maakt deel uit van een Enterprise-overeenkomst. Mail naar [email protected] en we leggen alles uit.