Document type: Protocol | Version: 1.0 | Published: 28 July 2026
Executive Abstract
A protocol for treating retrieved web content as untrusted data and preventing external instructions from silently controlling AI agents.
Definisi
Indirect prompt injection terjadi ketika instruksi berbahaya ditempatkan di website, dokumen, email, knowledge base, atau data lain yang kemudian diretrieval oleh model. Sistem aman harus memisahkan user intent, system policy, tool permission, dan retrieved content.
Ruang Lingkup
- RAG pipelines, browser agents, web retrieval, document ingestion, email agents, vector stores, dan tool-using assistants.
- Instruction hierarchy, content labeling, sanitization, tool authorization, monitoring, dan incident response.
- Knowledge-base poisoning dan cross-context data exfiltration.
Batas dan Pengecualian
- Tidak mengandalkan regex atau blocklist sebagai satu-satunya kontrol.
- Tidak memperlakukan semua retrieved text sebagai trusted instruction.
- Tidak memberikan tool permission berdasarkan klaim yang berasal dari content tidak tepercaya.
Model Operasional
Trust Boundary
Retrieved content masuk sebagai data, bukan policy atau command.
Instruction Separation
System, developer, user, tool, dan external content diberi boundary yang eksplisit.
Least Privilege
Agent hanya menerima tool dan data minimum untuk tugasnya.
Action Confirmation
Write, send, purchase, delete, disclose, dan privileged action memerlukan control tambahan.
Detection and Logging
Suspicious instruction, tool call, data access, dan policy conflict dicatat.
Recovery
Sistem dapat menghentikan task, membatalkan action, dan menyimpan evidence insiden.
Langkah Implementasi atau Pengujian
- 1. Petakan semua retrieval source.
- 2. Label external content sebagai untrusted.
- 3. Batasi tool dan credential per task.
- 4. Tambahkan policy check sebelum action.
- 5. Uji dengan adversarial documents dan poisoned knowledge entries.
- 6. Review log dan update controls.
Evidence Requirements
- Threat model.
- Adversarial test corpus.
- Tool permission matrix.
- Detection and action logs.
- Incident and remediation record.
Governance dan Versioning
Protocol harus menjadi bagian dari secure development lifecycle. Security, product, legal, dan operations perlu menentukan action yang membutuhkan approval manusia.
Keterbatasan
- Model tetap dapat salah mengklasifikasikan instruksi.
- Attack dapat menggunakan bahasa, encoding, visual, atau multi-step context.
- Tidak ada satu control yang menghilangkan seluruh prompt injection risk.
Sumber Primer
GEO.or.id operates as an independent research and methodology platform. This document does not provide a ranking guarantee, legal opinion, or permanent visibility claim.
Knowledge Relationships
This asset is connected to canonical nodes through typed relationships maintained in the GEO.or.id knowledge registry.
- Is Part Of: Protocols
- Related To: Agent Action Authorization Protocol
- Related To: Agent2Agent Protocol and Agent Cards
- Related To: Agentic Product Identity Protocol
- Related To: Graph
- Related To: System Map
