Enterprise
Visão Geral
Normalmente a resposta da IA vai direta ao visitante. Com o classificador ativo, um segundo modelo independente lê primeiro cada resposta e decide se é segura de enviar: o bot foi enganado ao ponto de sair do seu papel, está a dar aconselhamento regulado, está a entrar num tema que proibiu? Uma resposta sinalizada nunca chega ao visitante tal como está — é reescrita uma vez, e se a reescrita continuar sinalizada, aparece a sua mensagem de recurso.
Como funciona
- A IA responde como sempre - nada muda no modelo principal
- O classificador lê o rascunho - um segundo modelo rápido verifica-o segundo as categorias ativadas
- Respostas sinalizadas recebem uma reescrita - a violação volta ao modelo principal, que escreve uma resposta corrigida, verificada de novo
- O recurso como último remédio - se a reescrita continuar sinalizada, o visitante vê a sua mensagem de recurso segura
Rascunho de resposta
Sinalizada
O visitante vê
Resposta corrigida
O que verifica
- Quebras de papel e injeção de prompts - sempre ativo: o bot obedece a instruções escondidas numa mensagem, revela as próprias regras ou abandona o papel de suporte
- Aconselhamento médico - diagnóstico, tratamento ou dosagem; a informação de produto continua permitida
- Aconselhamento jurídico - interpretar a lei para a situação do visitante; expor as suas próprias políticas continua permitido
- Aconselhamento financeiro - recomendações de investimento ou finanças pessoais; os seus próprios preços e taxas continuam permitidos
- Os seus temas proibidos - uma lista livre escrita por si, um tema por linha — é aqui que define o que é sensível para o seu negócio
O registo de incidentes
Cada sinalização fica registada na página de definições: a categoria, a razão do classificador, o rascunho bloqueado e o que o visitante viu em vez disso. É a sua ferramenta de afinação de falsos positivos E o rasto de auditoria para a sua própria equipa de conformidade. O conteúdo dos incidentes passa pelo mascaramento de PII como toda a superfície guardada, e no modo de retenção zero só ficam os metadados — nenhum conteúdo de mensagens.
Se o próprio classificador falhar
Um segundo modelo é uma segunda coisa que pode falhar. Escolhe o que acontece então:
- Fail-open (predefinição) - a resposta não verificada é entregue; ganha a disponibilidade
- Fail-closed - aparece o recurso em vez disso, para sites onde uma resposta não verificada é pior do que nenhuma
Bom saber
- Só age sobre a resposta, nunca sobre a pergunta - se o seu bot já recusa ou responde de forma segura, nada é sinalizado, e isso está correto. O classificador é uma rede de segurança para a rara resposta que escapa, não uma verificação do que o visitante perguntou. Tentar contornar um bot bem-comportado normalmente não mostrará nenhuma sinalização, porque o bot tratou disso sozinho.
- Latência - a verificação acrescenta cerca de meio segundo a cada resposta, e uma resposta sinalizada paga ainda uma reescrita completa
- Não é uma garantia - é um modelo a julgar outro; é uma camada independente adicional, não uma barreira absoluta
- O chat de teste mostra os vereditos - o chat de teste do painel aplica o mesmo que o widget ao vivo e diz-lhe quando uma resposta foi sinalizada; tente enganar o seu próprio bot
- Escreva o recurso na língua dos seus visitantes - é mostrado tal e qual; a predefinição integrada está em inglês
- Funciona em conjunto com as suas instruções de IA - as instruções orientam o primeiro modelo, o classificador apanha o que escapa; use ambos
Nota: O classificador de respostas faz parte de um acordo Enterprise. Escreva para [email protected] e explicamos-lhe tudo.