企业版
概述
通常 AI 的回复直接发给访客。开启分类器后,第二个独立模型会先阅读每条回复并判断是否可以安全发送:机器人是否被诱骗偏离角色,是否在给出受监管的建议,是否涉及您禁止的话题?被标记的回复绝不会原样到达访客 — 它会被重写一次,如果重写后仍被标记,则改为显示您的兜底消息。
工作原理
- AI 照常回答 - 主模型没有任何变化
- 分类器阅读草稿 - 快速的第二个模型按您启用的类别进行检查
- 被标记的回复获得一次重写 - 违规反馈给主模型,写出修正后的回复并再次检查
- 兜底作为最后手段 - 如果重写仍被标记,访客将看到您的安全兜底消息
检查内容
- 角色偏离和提示注入 - 始终开启:机器人服从消息中隐藏的指令、泄露自己的规则或放弃客服角色
- 医疗建议 - 诊断、治疗或剂量;产品信息仍然允许
- 法律建议 - 为访客的情况解释法律;说明您自己的政策仍然允许
- 金融建议 - 投资或个人理财推荐;您自己的价格和费用仍然允许
- 您的禁止话题 - 您自己撰写的自由列表,每行一个话题 — 在这里定义什么对您的业务是敏感的
事件日志
每个标记都记录在设置页面:类别、分类器的理由、被拦截的草稿以及访客替代看到的内容。它既是您调整误报的工具,也是可以向自己的合规团队展示的审计记录。事件内容像所有存储面一样经过个人信息脱敏,在零保留模式下只保留元数据 — 没有消息内容。
如果分类器本身失败
第二个模型意味着第二个可能超时的环节。届时会发生什么,由您选择:
- Fail-open(默认) - 传递未检查的回复;可用性获胜
- Fail-closed - 改为显示兜底,适用于未检查的回复比没有回复更糟的网站
值得了解
- 它只作用于回复,从不作用于提问 - 如果您的机器人已经拒绝或安全地回答,什么都不会被标记,这是正确的。分类器是为极少数漏网回复准备的安全网,而不是对访客所问内容的检查。试图破解一个表现良好的机器人通常不会显示标记,因为机器人自己已经处理了。
- 延迟 - 检查为每条回复增加约半秒,被标记的回复还要额外支付一次完整重写
- 并非保证 - 一个模型评判另一个;这是额外的独立层,不是绝对屏障
- 测试聊天显示判定 - 控制台测试聊天与线上组件一样执行,并在回复被标记时告诉您;不妨试着骗过自己的机器人
- 用访客的语言撰写兜底消息 - 它按原样显示;内置默认为英文
- 与您的 AI 指令协同工作 - 指令引导第一个模型,分类器捕捉漏网之鱼;两者都要用