Enterprise
Översikt
Normalt går AI:ns svar direkt till besökaren. Med klassificeraren på läser en andra, oberoende modell först varje svar och avgör om det är säkert att skicka: lurades boten ur sin roll, ger den reglerad rådgivning, ger den sig in på ett ämne du förbjudit? Ett flaggat svar når aldrig besökaren som det är — det skrivs om en gång, och om även omskrivningen flaggas visas ditt reservmeddelande i stället.
Hur det fungerar
- AI:n svarar som vanligt - inget ändras i huvudmodellen
- Klassificeraren läser utkastet - en snabb andra modell granskar det mot dina aktiverade kategorier
- Flaggade svar får en omskrivning - överträdelsen skickas tillbaka till huvudmodellen, som skriver ett korrigerat svar som granskas igen
- Reserven som sista utväg - om även omskrivningen flaggas ser besökaren ditt säkra reservmeddelande
Svarsutkast
Flaggat
Besökaren ser
Korrigerat svar
Vad som granskas
- Rollbrott och prompt injection - alltid aktivt: boten lyder dolda instruktioner i ett meddelande, avslöjar sina egna regler eller överger sin supportroll
- Medicinsk rådgivning - diagnos, behandling eller dosering; produktinformation förblir tillåten
- Juridisk rådgivning - att tolka lagen för besökarens situation; att beskriva era egna policyer förblir tillåtet
- Finansiell rådgivning - investerings- eller privatekonomiska rekommendationer; era egna priser och avgifter förblir tillåtna
- Dina förbjudna ämnen - en fri lista som du skriver, ett ämne per rad — här definierar du vad som är känsligt för din verksamhet
Incidentloggen
Varje flaggning registreras på inställningssidan: kategorin, klassificerarens motivering, det blockerade utkastet och vad besökaren såg i stället. Det är både ditt verktyg för att justera falsklarm OCH revisionsspåret för ditt eget compliance-team. Incidentinnehåll går genom PII-maskering som varje lagrad yta, och i Zero Retention-läge behålls bara metadata — inget meddelandeinnehåll.
Om klassificeraren själv fallerar
En andra modell är en andra sak som kan ta för lång tid. Du väljer vad som händer då:
- Fail-open (standard) - det ogranskade svaret levereras; tillgänglighet vinner
- Fail-closed - reserven visas i stället, för webbplatser där ett ogranskat svar är värre än inget svar
Bra att veta
- Det agerar bara på svaret, aldrig på frågan - om din bot redan vägrar eller svarar säkert flaggas ingenting, och det är korrekt. Klassificeraren är ett skyddsnät för det sällsynta svar som slinker igenom, inte en kontroll av vad besökaren frågade. Att försöka lura en väluppfostrad bot visar oftast ingen flaggning, eftersom boten hanterade det själv.
- Latens - granskningen lägger ungefär en halv sekund på varje svar, och ett flaggat svar betalar dessutom en hel omskrivning
- Ingen garanti - en modell bedömer en annan; det är ett extra oberoende lager, ingen absolut barriär
- Testchatten visar domar - instrumentpanelens testchatt tillämpar som live-widgeten och säger till när ett svar flaggats; försök gärna lura din egen bot
- Skriv reserven på dina besökares språk - den visas ordagrant; den inbyggda standarden är på engelska
- Fungerar tillsammans med dina AI-instruktioner - instruktionerna styr den första modellen, klassificeraren fångar det som slinker igenom; använd båda
Obs! Svarsklassificeraren ingår i ett Enterprise-avtal. Mejla [email protected] så går vi igenom allt.