Kurumsal
Genel Bakış
Normalde yapay zekanın yanıtı doğrudan ziyaretçiye gider. Sınıflandırıcı açıkken, ikinci ve bağımsız bir model önce her yanıtı okur ve gönderilmesinin güvenli olup olmadığına karar verir: bot rolünden çıkarılacak şekilde kandırıldı mı, düzenlemeye tabi tavsiye mi veriyor, yasakladığınız bir konuya mı giriyor? İşaretlenen bir yanıt ziyaretçiye asla olduğu gibi ulaşmaz — bir kez yeniden yazılır ve yeniden yazım da işaretlenirse yerine yedek mesajınız gösterilir.
Nasıl Çalışır
- Yapay zeka her zamanki gibi yanıtlar - ana modelde hiçbir şey değişmez
- Sınıflandırıcı taslağı okur - hızlı ikinci bir model, etkin kategorilerinize göre denetler
- İşaretlenen yanıtlar bir kez yeniden yazılır - ihlal ana modele geri bildirilir, düzeltilmiş bir yanıt yazılır ve tekrar denetlenir
- Son çare olarak yedek - yeniden yazım da işaretlenirse ziyaretçi güvenli yedek mesajınızı görür
Yanıt taslağı
İşaretlendi
Ziyaretçi görür
Düzeltilmiş yanıt
Neleri denetler
- Rol ihlalleri ve prompt injection - her zaman etkin: botun mesaja gizlenmiş talimatlara uyması, kendi kurallarını açıklaması veya destek rolünü bırakması
- Tıbbi tavsiye - teşhis, tedavi veya doz; ürün bilgisi serbest kalır
- Hukuki tavsiye - ziyaretçinin durumu için yasayı yorumlamak; kendi politikalarınızı belirtmek serbest kalır
- Finansal tavsiye - yatırım veya kişisel finans önerileri; kendi fiyatlarınız ve ücretleriniz serbest kalır
- Yasak konularınız - sizin yazdığınız serbest bir liste, her satıra bir konu — işletmeniz için neyin hassas olduğunu burada tanımlarsınız
Olay Günlüğü
Her işaret ayarlar sayfasına kaydedilir: kategori, sınıflandırıcının gerekçesi, engellenen taslak ve ziyaretçinin yerine gördüğü. Hem yanlış alarmları ayarlama aracınız HEM DE kendi uyum ekibinize gösterebileceğiniz denetim izidir. Olay içeriği, saklanan her yüzey gibi PII maskelemeden geçer; Sıfır Saklama modunda yalnızca meta veriler tutulur — mesaj içeriği yok.
Sınıflandırıcının kendisi çökerse
İkinci bir model, zaman aşımına uğrayabilecek ikinci bir şey demektir. O zaman ne olacağını siz seçersiniz:
- Fail-open (varsayılan) - denetlenmemiş yanıt teslim edilir; erişilebilirlik kazanır
- Fail-closed - yerine yedek gösterilir, denetlenmemiş bir yanıtın hiç yanıttan kötü olduğu siteler için
Bilmekte fayda var
- Yalnızca yanıta etki eder, asla soruya değil - botunuz zaten reddediyor veya güvenli yanıt veriyorsa hiçbir şey işaretlenmez ve bu doğrudur. Sınıflandırıcı, arada bir sızan nadir yanıt için bir güvenlik ağıdır, ziyaretçinin ne sorduğunun denetimi değil. İyi davranan bir botu kandırmaya çalışmak genellikle hiçbir işaret göstermez, çünkü bot bunu kendi başına halletmiştir.
- Gecikme - denetim her yanıta yaklaşık yarım saniye ekler; işaretlenen bir yanıt ayrıca tam bir yeniden yazım bedeli öder
- Garanti değil - bir model diğerini yargılıyor; bu ek bir bağımsız katmandır, mutlak bir bariyer değil
- Test sohbeti kararları gösterir - paneldeki test sohbeti canlı widget gibi uygular ve bir yanıt işaretlendiğinde söyler; kendi botunuzu kandırmayı deneyin
- Yedeği ziyaretçilerinizin dilinde yazın - olduğu gibi gösterilir; yerleşik varsayılan İngilizcedir
- Yapay zeka talimatlarınızla birlikte çalışır - talimatlar ilk modeli yönlendirir, sınıflandırıcı kaçanı yakalar; ikisini de kullanın
Not: Yanıt Sınıflandırıcı bir Enterprise anlaşmasının parçasıdır. [email protected] adresine yazın, her şeyi adım adım anlatalım.