Enterprise
Overzicht
Normaal gaat het antwoord van de AI rechtstreeks naar de bezoeker. Met antwoordclassificatie aan leest een tweede, onafhankelijk model elk antwoord eerst en beslist of het veilig te versturen is: is de bot misleid om uit zijn rol te stappen, geeft hij gereguleerd advies, gaat hij in op een onderwerp dat u hebt verboden? Een gemarkeerd antwoord bereikt de bezoeker nooit zoals het is — het wordt één keer herschreven, en is ook de herschrijving gemarkeerd, dan verschijnt uw terugvalbericht.
Hoe het werkt
- De AI antwoordt zoals gewoonlijk - er verandert niets aan het hoofdmodel
- De classifier leest het concept - een snel tweede model toetst het aan uw ingeschakelde categorieën
- Gemarkeerde antwoorden krijgen één herschrijving - de overtreding gaat terug naar het hoofdmodel, dat een gecorrigeerd antwoord schrijft dat opnieuw wordt gecontroleerd
- Terugval als laatste redmiddel - is ook de herschrijving gemarkeerd, dan ziet de bezoeker uw veilige terugvalbericht
Conceptantwoord
Gemarkeerd
Bezoeker ziet
Gecorrigeerd antwoord
Wat wordt gecontroleerd
- Rolbreuken en prompt-injectie - altijd actief: de bot gehoorzaamt verborgen instructies in een bericht, onthult zijn eigen regels of laat zijn supportrol los
- Medisch advies - diagnose, behandeling of dosering; productinformatie blijft toegestaan
- Juridisch advies - de wet uitleggen voor de situatie van de bezoeker; uw eigen beleid benoemen blijft toegestaan
- Financieel advies - beleggings- of persoonlijk financieel advies; uw eigen prijzen en tarieven blijven toegestaan
- Uw verboden onderwerpen - een vrije lijst die u schrijft, één onderwerp per regel — hier bepaalt u wat gevoelig is voor uw bedrijf
Het incidentenlogboek
Elke markering wordt vastgelegd op de instellingenpagina: de categorie, de reden van de classifier, het geblokkeerde concept en wat de bezoeker in plaats daarvan zag. Het is zowel uw afstemtool voor valse positieven als het auditspoor voor uw eigen compliance-team. Incidentinhoud gaat door PII-maskering zoals elk opgeslagen oppervlak, en in Zero Retention-modus blijven alleen de metadata over — geen berichtinhoud.
Als de classifier zelf uitvalt
Een tweede model is een tweede ding dat kan uitvallen. U kiest wat er dan gebeurt:
- Fail-open (standaard) - het ongecontroleerde antwoord wordt geleverd; beschikbaarheid wint
- Fail-closed - in plaats daarvan verschijnt de terugval, voor sites waar een ongecontroleerd antwoord erger is dan geen antwoord
Goed om te weten
- Het reageert alleen op het antwoord, nooit op de vraag - als uw bot al weigert of veilig antwoordt, wordt er niets gemarkeerd, en dat klopt. De classifier is een vangnet voor het zeldzame antwoord dat erdoorheen glipt, geen controle op wat de bezoeker vroeg. Proberen een braaf gedragende bot te kraken toont meestal geen markering, omdat de bot het zelf afhandelde.
- Latentie - de controle voegt ongeveer een halve seconde toe aan elk antwoord, en een gemarkeerd antwoord betaalt daarbovenop een volledige herschrijving
- Geen garantie - dit is het ene model dat het andere beoordeelt; het is een extra onafhankelijke laag, geen absolute barrière
- De testchat toont oordelen - de testchat van het dashboard handhaaft zoals de live widget en vertelt u wanneer een antwoord is gemarkeerd; probeer gerust uw eigen bot te misleiden
- Schrijf de terugval in de taal van uw bezoekers - hij wordt letterlijk getoond; de ingebouwde standaard is Engels
- Werkt samen met uw AI-instructies - instructies sturen het eerste model, de classifier vangt af wat erdoorheen glipt; gebruik beide
Opmerking: Antwoordclassificatie maakt deel uit van een Enterprise-overeenkomst. Mail naar [email protected] en we leggen alles uit.