
Índice
Um assistente pode encontrar instruções maliciosas dentro de páginas ou documentos consultados. A solução precisa tratar esse conteúdo como dado, sem permitir que ele substitua as regras de acesso e operação.
Como avaliar esta decisão
Mapeie fontes externas e ações disponíveis. Quanto maior a capacidade de agir, maior a necessidade de controles fora do modelo. Separe leitura de dados de autorização para executar comandos, enviar mensagens ou alterar registros. Filtrar algumas frases não comprova proteção completa; o teste deve verificar limites de permissão e comportamento diante de instruções conflitantes.
Critérios para comparar propostas
- Fontes: identificar conteúdo não confiável e manter contexto de origem.
- Ferramentas: limitar operações e validar parâmetros no servidor conforme o usuário e a finalidade.
- Revisão: exigir aprovação para ações de maior consequência e registrar tentativas rejeitadas sem vazar dados.
Um cenário para discutir com o fornecedor
Exemplo hipotético: um documento pede ao assistente que envie dados para outro endereço. A aplicação não deve executar essa instrução apenas porque ela apareceu em uma fonte recuperada.
O que validar na entrega
Inclua ataques simulados autorizados em documentos, mensagens e resultados de busca. Verifique que a proteção depende de controles de aplicação, não somente da promessa de que o modelo obedecerá ao prompt principal.
Prepare a conversa sobre o projeto
A Quantum9 pode implementar e testar limites no fluxo específico. Traga fontes, ferramentas e ações permitidas para definir ameaças relevantes e critérios de liberação, sem prometer ausência absoluta de risco.
Desenvolvimento com IA agêntica · Mapear a prioridade da empresa