エンタープライズ
概要
通常、AIの回答は訪問者に直接届きます。クラシファイアを有効にすると、2つ目の独立したモデルがまず各回答を読み、送信しても安全か判断します: ボットが騙されてロールを逸脱していないか、規制対象のアドバイスをしていないか、禁止したトピックに踏み込んでいないか。フラグされた回答がそのまま訪問者に届くことはありません — 一度書き直され、書き直しもフラグされた場合は、代わりにフォールバックメッセージが表示されます。
仕組み
- AIは通常どおり回答 - メインモデルは何も変わりません
- クラシファイアが下書きを読む - 高速な2つ目のモデルが有効なカテゴリに照らしてチェックします
- フラグされた回答は一度書き直される - 違反がメインモデルにフィードバックされ、修正された回答が再度チェックされます
- 最終手段としてのフォールバック - 書き直しもフラグされた場合、訪問者には安全なフォールバックメッセージが表示されます
回答の下書き
フラグ済み
訪問者に表示
修正された回答
チェック内容
- ロール逸脱とプロンプトインジェクション - 常に有効: ボットがメッセージに隠された指示に従う、自身のルールを明かす、サポートロールを放棄する
- 医療アドバイス - 診断、治療、投与量; 製品情報は引き続き許可
- 法律アドバイス - 訪問者の状況への法解釈; 自社ポリシーの説明は引き続き許可
- 金融アドバイス - 投資や個人資産の推奨; 自社の価格や手数料は引き続き許可
- あなたの禁止トピック - 自由に書けるリスト、1行1トピック — ビジネスにとって何がセンシティブかをここで定義します
インシデントログ
すべてのフラグは設定ページに記録されます: カテゴリ、クラシファイアの理由、ブロックされた下書き、訪問者が代わりに見た内容。誤検知を調整するツールであると同時に、自社のコンプライアンスチームに示せる監査証跡でもあります。インシデントの内容は、すべての保存面と同様にPIIマスキングを通過し、ゼロ保存モードではメタデータのみが保持されます — メッセージ内容は残りません。
クラシファイア自体が失敗した場合
2つ目のモデルは、タイムアウトしうる2つ目の要素でもあります。その場合の動作を選択できます:
- Fail-open(デフォルト) - 未チェックの回答が配信されます; 可用性が優先
- Fail-closed - 代わりにフォールバックが表示されます。未チェックの回答が無回答より悪いサイト向け
知っておくと便利
- 回答にのみ作用し、質問には決して作用しません - ボットがすでに拒否するか安全に回答していれば、何もフラグされず、それが正しい動作です。クラシファイアは、すり抜けた稀な回答のための安全ネットであり、訪問者が何を尋ねたかのチェックではありません。行儀のよいボットを破ろうとしても、たいていフラグは出ません。ボットが自分で対処したからです。
- レイテンシ - チェックは各回答に約0.5秒を追加し、フラグされた回答はさらに完全な書き直しのコストを払います
- 保証ではない - 1つのモデルが別のモデルを判定する仕組み; 追加の独立レイヤーであり、絶対的な壁ではありません
- テストチャットが判定を表示 - ダッシュボードのテストチャットはライブウィジェットと同様に適用され、回答がフラグされたことを教えてくれます; 自分のボットを騙してみてください
- フォールバックは訪問者の言語で - そのまま表示されます; 組み込みのデフォルトは英語です
- AI指示と連携 - 指示は1つ目のモデルを導き、クラシファイアはすり抜けたものを捕捉します; 両方使ってください