Empresa
Descripción general
Normalmente la respuesta de la IA va directa al visitante. Con el clasificador activado, un segundo modelo independiente lee primero cada respuesta y decide si es segura de enviar: ¿engañaron al bot para salirse de su rol?, ¿está dando consejo regulado?, ¿está entrando en un tema que prohibiste? Una respuesta marcada nunca llega al visitante tal cual — se reescribe una vez, y si la reescritura sigue marcada, se muestra tu mensaje de reserva.
Cómo funciona
- La IA responde como siempre - nada cambia en el modelo principal
- El clasificador lee el borrador - un segundo modelo rápido lo revisa según tus categorías activadas
- Las respuestas marcadas reciben una reescritura - la infracción se devuelve al modelo principal, que escribe una respuesta corregida que se revisa de nuevo
- La reserva como último recurso - si la reescritura sigue marcada, el visitante ve tu mensaje de reserva seguro
Borrador de respuesta
Marcada
El visitante ve
Respuesta corregida
Qué revisa
- Rupturas de rol e inyección de prompts - siempre activo: el bot obedece instrucciones ocultas en un mensaje, revela sus propias reglas o abandona su rol de soporte
- Consejo médico - diagnóstico, tratamiento o dosis; la información de producto sigue permitida
- Consejo legal - interpretar la ley para la situación del visitante; explicar tus propias políticas sigue permitido
- Consejo financiero - recomendaciones de inversión o finanzas personales; tus propios precios y tarifas siguen permitidos
- Tus temas prohibidos - una lista libre que tú escribes, un tema por línea — aquí defines qué es sensible para tu negocio
El registro de incidentes
Cada marca queda registrada en la página de ajustes: la categoría, la razón del clasificador, el borrador bloqueado y lo que el visitante vio en su lugar. Es tu herramienta para ajustar falsos positivos Y el rastro de auditoría para tu propio equipo de cumplimiento. El contenido de los incidentes pasa por el enmascaramiento de PII como toda superficie almacenada, y en modo de retención cero solo se guardan los metadatos — nada de contenido de mensajes.
Si el propio clasificador falla
Un segundo modelo es una segunda cosa que puede fallar. Tú eliges qué pasa entonces:
- Fail-open (predeterminado) - se entrega la respuesta sin revisar; gana la disponibilidad
- Fail-closed - se muestra la reserva en su lugar, para sitios donde una respuesta sin revisar es peor que ninguna
Conviene saber
- Solo actúa sobre la respuesta, nunca sobre la pregunta - si tu bot ya rechaza o responde de forma segura, no se marca nada, y eso es correcto. El clasificador es una red de seguridad para la rara respuesta que se cuela, no un control de lo que preguntó el visitante. Intentar burlar a un bot bien educado normalmente no mostrará ninguna marca, porque el bot lo gestionó por su cuenta.
- Latencia - la revisión añade medio segundo aproximado a cada respuesta, y una respuesta marcada paga además una reescritura completa
- No es una garantía - es un modelo juzgando a otro; es una capa independiente adicional, no una barrera absoluta
- El chat de pruebas muestra veredictos - el chat de pruebas del panel aplica lo mismo que el widget en vivo y te avisa cuando una respuesta fue marcada; intenta engañar a tu propio bot
- Escribe la reserva en el idioma de tus visitantes - se muestra tal cual; el predeterminado integrado está en inglés
- Funciona junto a tus instrucciones de IA - las instrucciones guían al primer modelo, el clasificador atrapa lo que se escapa; usa ambos
Nota: El clasificador de respuestas forma parte de un acuerdo Enterprise. Escribe a [email protected] y te lo explicamos paso a paso.