Enterprise
Panoramica
Normalmente la risposta dell'IA va dritta al visitatore. Con il classificatore attivo, un secondo modello indipendente legge prima ogni risposta e decide se è sicura da inviare: il bot è stato ingannato fino a uscire dal suo ruolo, sta dando consigli regolamentati, sta toccando un argomento che hai vietato? Una risposta segnalata non raggiunge mai il visitatore così com'è — viene riscritta una volta, e se anche la riscrittura è segnalata, appare il tuo messaggio di riserva.
Come funziona
- L'IA risponde come sempre - nulla cambia nel modello principale
- Il classificatore legge la bozza - un secondo modello veloce la controlla secondo le categorie attivate
- Le risposte segnalate ricevono una riscrittura - la violazione torna al modello principale, che scrive una risposta corretta, controllata di nuovo
- La riserva come ultima risorsa - se anche la riscrittura è segnalata, il visitatore vede il tuo messaggio di riserva sicuro
Bozza di risposta
Segnalata
Il visitatore vede
Risposta corretta
Cosa controlla
- Rotture di ruolo e prompt injection - sempre attivo: il bot obbedisce a istruzioni nascoste in un messaggio, rivela le proprie regole o abbandona il ruolo di assistenza
- Consigli medici - diagnosi, terapie o dosaggi; le informazioni sui prodotti restano consentite
- Consigli legali - interpretare la legge per la situazione del visitatore; esporre le proprie policy resta consentito
- Consigli finanziari - raccomandazioni di investimento o finanza personale; i tuoi prezzi e le tue tariffe restano consentiti
- I tuoi argomenti vietati - una lista libera che scrivi tu, un argomento per riga — qui definisci cosa è sensibile per la tua attività
Il registro incidenti
Ogni segnalazione è registrata nella pagina delle impostazioni: categoria, motivazione del classificatore, bozza bloccata e cosa ha visto il visitatore. È sia il tuo strumento di regolazione dei falsi positivi sia la traccia di audit per il tuo team di conformità. Il contenuto degli incidenti passa dal mascheramento PII come ogni superficie salvata, e in modalità Zero Retention restano solo i metadati — nessun contenuto dei messaggi.
Se il classificatore stesso si guasta
Un secondo modello è una seconda cosa che può andare in timeout. Scegli tu cosa succede allora:
- Fail-open (predefinito) - la risposta non controllata viene consegnata; vince la disponibilità
- Fail-closed - appare invece la riserva, per i siti dove una risposta non controllata è peggio di nessuna
Buono a sapersi
- Agisce solo sulla risposta, mai sulla domanda - se il tuo bot rifiuta già o risponde in modo sicuro, non viene segnalato nulla, ed è corretto. Il classificatore è una rete di sicurezza per la rara risposta che sfugge, non un controllo su ciò che ha chiesto il visitatore. Provare a ingannare un bot ben educato di solito non mostrerà alcuna segnalazione, perché il bot l'ha gestito da solo.
- Latenza - il controllo aggiunge circa mezzo secondo a ogni risposta, e una risposta segnalata paga in più una riscrittura completa
- Non una garanzia - è un modello che ne giudica un altro; è un livello indipendente aggiuntivo, non una barriera assoluta
- La chat di test mostra i verdetti - la chat di test della dashboard applica le stesse regole del widget live e ti dice quando una risposta è stata segnalata; prova pure a ingannare il tuo stesso bot
- Scrivi la riserva nella lingua dei tuoi visitatori - viene mostrata così com'è; il predefinito integrato è in inglese
- Funziona insieme alle tue istruzioni IA - le istruzioni guidano il primo modello, il classificatore cattura ciò che sfugge; usali entrambi
Nota: Il classificatore delle risposte fa parte di un accordo Enterprise. Scrivi a [email protected] e ti guideremo passo passo.