Dashboard'a Dön

Belgeler

Asyntai'yi nasıl kullanacağınızı öğrenin

Yanıt Sınıflandırıcı

İkinci bir yapay zeka modeli, her yanıtı ziyaretçiye ulaşmadan önce denetler

Yanıt Sınıflandırıcıya git
Kurumsal

Genel Bakış

Normalde yapay zekanın yanıtı doğrudan ziyaretçiye gider. Sınıflandırıcı açıkken, ikinci ve bağımsız bir model önce her yanıtı okur ve gönderilmesinin güvenli olup olmadığına karar verir: bot rolünden çıkarılacak şekilde kandırıldı mı, düzenlemeye tabi tavsiye mi veriyor, yasakladığınız bir konuya mı giriyor? İşaretlenen bir yanıt ziyaretçiye asla olduğu gibi ulaşmaz — bir kez yeniden yazılır ve yeniden yazım da işaretlenirse yerine yedek mesajınız gösterilir.

Nasıl Çalışır

  1. Yapay zeka her zamanki gibi yanıtlar - ana modelde hiçbir şey değişmez
  2. Sınıflandırıcı taslağı okur - hızlı ikinci bir model, etkin kategorilerinize göre denetler
  3. İşaretlenen yanıtlar bir kez yeniden yazılır - ihlal ana modele geri bildirilir, düzeltilmiş bir yanıt yazılır ve tekrar denetlenir
  4. Son çare olarak yedek - yeniden yazım da işaretlenirse ziyaretçi güvenli yedek mesajınızı görür
Yanıt Sınıflandırıcı
Yanıt taslağı İşaretlendi
Ziyaretçi görür Düzeltilmiş yanıt

Neleri denetler

  • Rol ihlalleri ve prompt injection - her zaman etkin: botun mesaja gizlenmiş talimatlara uyması, kendi kurallarını açıklaması veya destek rolünü bırakması
  • Tıbbi tavsiye - teşhis, tedavi veya doz; ürün bilgisi serbest kalır
  • Hukuki tavsiye - ziyaretçinin durumu için yasayı yorumlamak; kendi politikalarınızı belirtmek serbest kalır
  • Finansal tavsiye - yatırım veya kişisel finans önerileri; kendi fiyatlarınız ve ücretleriniz serbest kalır
  • Yasak konularınız - sizin yazdığınız serbest bir liste, her satıra bir konu — işletmeniz için neyin hassas olduğunu burada tanımlarsınız

Olay Günlüğü

Her işaret ayarlar sayfasına kaydedilir: kategori, sınıflandırıcının gerekçesi, engellenen taslak ve ziyaretçinin yerine gördüğü. Hem yanlış alarmları ayarlama aracınız HEM DE kendi uyum ekibinize gösterebileceğiniz denetim izidir. Olay içeriği, saklanan her yüzey gibi PII maskelemeden geçer; Sıfır Saklama modunda yalnızca meta veriler tutulur — mesaj içeriği yok.

Sınıflandırıcının kendisi çökerse

İkinci bir model, zaman aşımına uğrayabilecek ikinci bir şey demektir. O zaman ne olacağını siz seçersiniz:

  • Fail-open (varsayılan) - denetlenmemiş yanıt teslim edilir; erişilebilirlik kazanır
  • Fail-closed - yerine yedek gösterilir, denetlenmemiş bir yanıtın hiç yanıttan kötü olduğu siteler için

Bilmekte fayda var

  • Yalnızca yanıta etki eder, asla soruya değil - botunuz zaten reddediyor veya güvenli yanıt veriyorsa hiçbir şey işaretlenmez ve bu doğrudur. Sınıflandırıcı, arada bir sızan nadir yanıt için bir güvenlik ağıdır, ziyaretçinin ne sorduğunun denetimi değil. İyi davranan bir botu kandırmaya çalışmak genellikle hiçbir işaret göstermez, çünkü bot bunu kendi başına halletmiştir.
  • Gecikme - denetim her yanıta yaklaşık yarım saniye ekler; işaretlenen bir yanıt ayrıca tam bir yeniden yazım bedeli öder
  • Garanti değil - bir model diğerini yargılıyor; bu ek bir bağımsız katmandır, mutlak bir bariyer değil
  • Test sohbeti kararları gösterir - paneldeki test sohbeti canlı widget gibi uygular ve bir yanıt işaretlendiğinde söyler; kendi botunuzu kandırmayı deneyin
  • Yedeği ziyaretçilerinizin dilinde yazın - olduğu gibi gösterilir; yerleşik varsayılan İngilizcedir
  • Yapay zeka talimatlarınızla birlikte çalışır - talimatlar ilk modeli yönlendirir, sınıflandırıcı kaçanı yakalar; ikisini de kullanın

PII Maskeleme ile eşleşir: bir özellik neyin saklandığını, diğeri neyin söylendiğini denetler.

PII Maskeleme Kişisel veriler, mesaj herhangi bir yere kaydedilmeden önce maskelenir

Not: Yanıt Sınıflandırıcı bir Enterprise anlaşmasının parçasıdır. [email protected] adresine yazın, her şeyi adım adım anlatalım.