Enterprise
개요
보통 AI의 답변은 방문자에게 바로 전달됩니다. 분류기가 켜져 있으면 두 번째 독립 모델이 먼저 각 답변을 읽고 보내도 안전한지 판단합니다: 봇이 속아서 역할을 벗어났는지, 규제 대상 조언을 하는지, 금지한 주제를 다루는지. 플래그된 답변은 절대 그대로 방문자에게 도달하지 않습니다 — 한 번 재작성되고, 재작성본도 플래그되면 대체 메시지가 대신 표시됩니다.
작동 방식
- AI는 평소처럼 답변합니다 - 메인 모델은 아무것도 바뀌지 않습니다
- 분류기가 초안을 읽습니다 - 빠른 두 번째 모델이 활성화된 카테고리에 따라 검사합니다
- 플래그된 답변은 한 번 재작성됩니다 - 위반 내용이 메인 모델로 피드백되어 수정된 답변이 작성되고 다시 검사됩니다
- 최후 수단으로서의 대체 메시지 - 재작성본도 플래그되면 방문자는 안전한 대체 메시지를 봅니다
답변 초안
플래그됨
방문자가 보는 것
수정된 답변
검사 항목
- 역할 이탈과 프롬프트 인젝션 - 항상 활성: 봇이 메시지에 숨겨진 지시를 따르거나, 자신의 규칙을 공개하거나, 지원 역할을 버리는 경우
- 의료 조언 - 진단, 치료, 복용량; 제품 정보는 계속 허용
- 법률 조언 - 방문자의 상황에 대한 법 해석; 자체 정책 안내는 계속 허용
- 금융 조언 - 투자나 개인 금융 추천; 자체 가격과 수수료는 계속 허용
- 나만의 금지 주제 - 직접 작성하는 자유 목록, 한 줄에 한 주제 — 비즈니스에 민감한 것을 여기서 정의합니다
인시던트 로그
모든 플래그가 설정 페이지에 기록됩니다: 카테고리, 분류기의 사유, 차단된 초안, 방문자가 대신 본 내용. 오탐 조정 도구인 동시에 자체 컴플라이언스 팀에 보여줄 감사 추적입니다. 인시던트 내용은 모든 저장 표면처럼 개인정보 마스킹을 거치며, 제로 보존 모드에서는 메타데이터만 유지됩니다 — 메시지 내용은 없습니다.
분류기 자체가 실패하면
두 번째 모델은 시간 초과될 수 있는 두 번째 요소이기도 합니다. 그때 무슨 일이 일어날지 선택하세요:
- Fail-open(기본값) - 검사되지 않은 답변이 전달됩니다; 가용성 우선
- Fail-closed - 대신 대체 메시지가 표시됩니다. 검사되지 않은 답변이 무응답보다 나쁜 사이트용
알아두면 좋은 점
- 질문이 아니라 답변에만 작용합니다 - 봇이 이미 거부하거나 안전하게 답하면 아무것도 플래그되지 않으며, 그것이 정상입니다. 분류기는 빠져나간 드문 답변을 위한 안전망이지, 방문자가 무엇을 물었는지에 대한 검사가 아닙니다. 잘 행동하는 봇을 뚫으려 해도 대개 플래그가 뜨지 않는데, 봇이 스스로 처리했기 때문입니다.
- 지연 시간 - 검사는 모든 답변에 약 0.5초를 추가하며, 플래그된 답변은 전체 재작성 비용을 추가로 지불합니다
- 보장이 아님 - 한 모델이 다른 모델을 판정; 추가 독립 계층일 뿐 절대적 장벽이 아닙니다
- 테스트 채팅이 판정을 표시 - 대시보드 테스트 채팅은 실제 위젯처럼 적용하며 답변이 플래그되면 알려줍니다; 직접 봇을 속여 보세요
- 대체 메시지는 방문자의 언어로 - 그대로 표시됩니다; 내장 기본값은 영어입니다
- AI 지침과 함께 작동 - 지침은 첫 모델을 이끌고, 분류기는 빠져나간 것을 잡습니다; 둘 다 사용하세요