
índice
Un asistente puede encontrar instrucciones maliciosas en las páginas o documentos consultados. La solución debe tratar este contenido como datos, sin permitir que anule las reglas de acceso y operación.
Cómo evaluar esta decisión
Mapear fuentes externas y acciones disponibles. Cuanto mayor sea la capacidad de actuar, mayor será la necesidad de controles fuera del modelo. Lectura separada de datos de autorización para ejecutar comandos, enviar mensajes o cambiar registros. Filtrar algunas frases no garantiza una protección completa; la prueba debe verificar los límites de permiso y el comportamiento ante instrucciones contradictorias.
Criterios para comparar propuestas.
- Fuentes: identifique contenido no confiable y mantenga el contexto de la fuente.
- Herramientas: limitar operaciones y validar parámetros en el servidor según el usuario y finalidad.
- Revisión: exigir aprobación para acciones de mayor consecuencia y registrar intentos rechazados sin filtrar datos.
Un escenario para discutir con el proveedor
Ejemplo hipotético: un documento solicita al asistente que envíe datos a otra dirección. La aplicación no debe ejecutar esta declaración sólo porque apareció en una fuente recuperada.
Qué validar en el momento de la entrega
Incluya ataques simulados autorizados en documentos, mensajes y resultados de búsqueda. Verifique que la protección dependa de los controles de la aplicación, no solo de la promesa de que el modelo obedecerá el mensaje principal.
Preparar la conversación sobre el proyecto.
Quantum9 puede implementar y probar límites en el flujo específico. Traiga fuentes, herramientas y acciones permitidas para definir amenazas relevantes y criterios de liberación, sin prometer ausencia absoluta de riesgo.
Desarrollo con IA agéntica · Mapear la prioridad de la empresa