输出分类器

第二个 AI 模型在每条回复到达访客之前进行检查

前往输出分类器
企业版

概述

通常 AI 的回复直接发给访客。开启分类器后,第二个独立模型会先阅读每条回复并判断是否可以安全发送:机器人是否被诱骗偏离角色,是否在给出受监管的建议,是否涉及您禁止的话题?被标记的回复绝不会原样到达访客 — 它会被重写一次,如果重写后仍被标记,则改为显示您的兜底消息。

工作原理

  1. AI 照常回答 - 主模型没有任何变化
  2. 分类器阅读草稿 - 快速的第二个模型按您启用的类别进行检查
  3. 被标记的回复获得一次重写 - 违规反馈给主模型,写出修正后的回复并再次检查
  4. 兜底作为最后手段 - 如果重写仍被标记,访客将看到您的安全兜底消息
输出分类器
回复草稿 已标记
访客看到 修正后的回复

检查内容

  • 角色偏离和提示注入 - 始终开启:机器人服从消息中隐藏的指令、泄露自己的规则或放弃客服角色
  • 医疗建议 - 诊断、治疗或剂量;产品信息仍然允许
  • 法律建议 - 为访客的情况解释法律;说明您自己的政策仍然允许
  • 金融建议 - 投资或个人理财推荐;您自己的价格和费用仍然允许
  • 您的禁止话题 - 您自己撰写的自由列表,每行一个话题 — 在这里定义什么对您的业务是敏感的

事件日志

每个标记都记录在设置页面:类别、分类器的理由、被拦截的草稿以及访客替代看到的内容。它既是您调整误报的工具,也是可以向自己的合规团队展示的审计记录。事件内容像所有存储面一样经过个人信息脱敏,在零保留模式下只保留元数据 — 没有消息内容。

如果分类器本身失败

第二个模型意味着第二个可能超时的环节。届时会发生什么,由您选择:

  • Fail-open(默认) - 传递未检查的回复;可用性获胜
  • Fail-closed - 改为显示兜底,适用于未检查的回复比没有回复更糟的网站

值得了解

  • 它只作用于回复,从不作用于提问 - 如果您的机器人已经拒绝或安全地回答,什么都不会被标记,这是正确的。分类器是为极少数漏网回复准备的安全网,而不是对访客所问内容的检查。试图破解一个表现良好的机器人通常不会显示标记,因为机器人自己已经处理了。
  • 延迟 - 检查为每条回复增加约半秒,被标记的回复还要额外支付一次完整重写
  • 并非保证 - 一个模型评判另一个;这是额外的独立层,不是绝对屏障
  • 测试聊天显示判定 - 控制台测试聊天与线上组件一样执行,并在回复被标记时告诉您;不妨试着骗过自己的机器人
  • 用访客的语言撰写兜底消息 - 它按原样显示;内置默认为英文
  • 与您的 AI 指令协同工作 - 指令引导第一个模型,分类器捕捉漏网之鱼;两者都要用

与个人信息脱敏配对:一个功能控制存储什么,另一个控制说什么。

个人信息脱敏 个人数据在消息被存储到任何地方之前即被脱敏

注意: 输出分类器是 Enterprise 协议的一部分。请致信 [email protected],我们会为您详细说明。