Retrieval Security and Indirect Prompt Injection Protocol

Document type: Protocol   |   Version: 1.0   |   Published: 28 July 2026

Executive Abstract

A protocol for treating retrieved web content as untrusted data and preventing external instructions from silently controlling AI agents.

Definisi

Indirect prompt injection terjadi ketika instruksi berbahaya ditempatkan di website, dokumen, email, knowledge base, atau data lain yang kemudian diretrieval oleh model. Sistem aman harus memisahkan user intent, system policy, tool permission, dan retrieved content.

Ruang Lingkup

  • RAG pipelines, browser agents, web retrieval, document ingestion, email agents, vector stores, dan tool-using assistants.
  • Instruction hierarchy, content labeling, sanitization, tool authorization, monitoring, dan incident response.
  • Knowledge-base poisoning dan cross-context data exfiltration.

Batas dan Pengecualian

  • Tidak mengandalkan regex atau blocklist sebagai satu-satunya kontrol.
  • Tidak memperlakukan semua retrieved text sebagai trusted instruction.
  • Tidak memberikan tool permission berdasarkan klaim yang berasal dari content tidak tepercaya.

Model Operasional

Trust Boundary

Retrieved content masuk sebagai data, bukan policy atau command.

Instruction Separation

System, developer, user, tool, dan external content diberi boundary yang eksplisit.

Least Privilege

Agent hanya menerima tool dan data minimum untuk tugasnya.

Action Confirmation

Write, send, purchase, delete, disclose, dan privileged action memerlukan control tambahan.

Detection and Logging

Suspicious instruction, tool call, data access, dan policy conflict dicatat.

Recovery

Sistem dapat menghentikan task, membatalkan action, dan menyimpan evidence insiden.

Langkah Implementasi atau Pengujian

  • 1. Petakan semua retrieval source.
  • 2. Label external content sebagai untrusted.
  • 3. Batasi tool dan credential per task.
  • 4. Tambahkan policy check sebelum action.
  • 5. Uji dengan adversarial documents dan poisoned knowledge entries.
  • 6. Review log dan update controls.

Evidence Requirements

  • Threat model.
  • Adversarial test corpus.
  • Tool permission matrix.
  • Detection and action logs.
  • Incident and remediation record.

Governance dan Versioning

Protocol harus menjadi bagian dari secure development lifecycle. Security, product, legal, dan operations perlu menentukan action yang membutuhkan approval manusia.

Keterbatasan

  • Model tetap dapat salah mengklasifikasikan instruksi.
  • Attack dapat menggunakan bahasa, encoding, visual, atau multi-step context.
  • Tidak ada satu control yang menghilangkan seluruh prompt injection risk.

Sumber Primer

GEO.or.id operates as an independent research and methodology platform. This document does not provide a ranking guarantee, legal opinion, or permanent visibility claim.

Knowledge Relationships

This asset is connected to canonical nodes through typed relationships maintained in the GEO.or.id knowledge registry.