间接提示注入与生产攻击面
间接提示注入(IPI)将指令嵌入外部内容——网页、邮件、共享文档——由代理系统在无用户显式操作下消费。IPI是2026年主要生产威胁:绕过用户输入过滤器,随代理处理更多外部内容而静默扩展。Nasr等人2025年自适应攻击打破了12种已发表IPI防御中90%以上。
问题定义
直接提示注入需要攻击者到达用户或其提示。IPI两者都不需要:攻击者将有效载荷放在代理可能读取的任何内容中——网页、收件箱中的邮件、GitHub issue、产品评论。代理在正常操作中拾取它并执行指令。用户是信使,不是意图来源。
核心概念
三种投递向量
- 检索增强生成(RAG)。 攻击者发布文档;检索步骤获取它;提示在用户问题前拼接它;模型执行攻击者的指令。
- 收件箱/文档工作流。 攻击者向用户发送邮件;代理读取邮件;提示包含邮件正文;模型遵循邮件指令。
- 工具输出。 攻击者控制代理使用的工具(例如返回攻击者控制结果的网页搜索);工具输出包含指令;代理的控制流遵循它们。
三者共享结构属性:攻击者控制提示的片段而不触及面向用户的输入。
为什么用户输入过滤器遗漏它
IPI有效载荷不出现在用户输入中。它出现在检索内容中。如果过滤器以用户输入为门控,有效载荷绕过它。如果过滤器以到达模型的所有内容为门控,它必须应用于任意检索文本——这很昂贵且对碰巧包含祈使语气语言的合法内容产生误报。
AI的信息流控制(IFC)
2026年防御范式借鉴自经典操作系统安全。将每个内容源视为安全标签。将用户查询标记为”可信”。将检索内容标记为”不可信”。将模型控制流视为信息流:由不可信内容触发的行动必须在执行前由可信输入批准。
CaMeL(Microsoft 2025)、ConfAIde(Stanford 2024)和NDSS 2026 IPI防御论文以不同方式操作化IFC。共同原则:只要代码和数据共享同一上下文窗口,遏制就是目标,而非预防。
攻击者后手
Nasr等人(2025年10月)用自适应攻击(梯度搜索、RL策略、随机搜索、72小时人类红队)测试了12种已发表的IPI防御。每个原本报告近零ASR的防御都被打破到>90% ASR。
方法论教训:仅在自适应攻击评估下发布防御。静态攻击基准不是鲁棒性的证据;攻击者可以知道防御。
真实事件
第25课涵盖EchoLeak(CVE-2025-32711, CVSS 9.3)——Microsoft 365 Copilot中首个公开记录的零点击IPI。GitHub Copilot Chat中的CamoLeak(CVSS 9.6)。GitHub Copilot中的CVE-2025-53773。生产部署正在被IPI在野外攻击,不仅在基准测试中。
OWASP和NIST框架
OWASP LLM Top 10(2025)将提示注入(直接+间接)列为LLM01,排名第一的应用层威胁。NIST AI SPD 2024称间接提示注入为”生成式AI最大的安全缺陷”。
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| IPI | ”间接提示注入” | 通过用户未编写的内容注入,代理在正常操作中消费 |
| RAG injection | ”投毒检索” | 攻击者发布检索步骤获取的内容;提示包含有效载荷 |
| Zero-click | ”无用户操作” | 攻击在代理操作期间自动触发;用户什么都不做 |
| IFC | ”信息流控制” | 基于标签的方法:来自不可信内容的行动需要可信批准 |
| Adaptive attack | ”梯度/RL红队” | 知道防御并针对其优化的攻击;诚实评估所需 |
| Benign instruction | ”请打印Yes” | 语义良性的IPI有效载荷;无关键词过滤器能捕获 |
| Scope violation | ”跨信任泄露” | 代理从一个信任上下文访问数据并输出到另一个 |
延伸阅读
- MDPI Information 17(1):54 — Indirect Prompt Injection Survey (January 2026) — 2023-2025综合
- Nasr et al. — The Attacker Moves Second (joint OpenAI/Anthropic/DeepMind, October 2025) — 自适应攻击评估
- Greshake et al. — Not what you’ve signed up for (arXiv:2302.12173) — 原始IPI论文
- OWASP — LLM Top 10 (2025) — 提示注入排名LLM01