前置知识: AI伦理与安全

间接提示注入与生产攻击面

6 minAdvanced

间接提示注入(IPI)将指令嵌入外部内容——网页、邮件、共享文档——由代理系统在无用户显式操作下消费。IPI是2026年主要生产威胁:绕过用户输入过滤器,随代理处理更多外部内容而静默扩展。Nasr等人2025年自适应攻击打破了12种已发表IPI防御中90%以上。

问题定义

直接提示注入需要攻击者到达用户或其提示。IPI两者都不需要:攻击者将有效载荷放在代理可能读取的任何内容中——网页、收件箱中的邮件、GitHub issue、产品评论。代理在正常操作中拾取它并执行指令。用户是信使,不是意来源。

核心概念

三种投递向量

  • 检索增强生成(RAG)。 攻击者发布文档;检索步骤获取它;提示在用户问题前拼接它;模型执行攻击者的指令。
  • 收件箱/文档工作流。 攻击者向用户发送邮件;代理读取邮件;提示包含邮件正文;模型遵循邮件指令。
  • 工具输出。 攻击者控制代理使用的工具(例如返回攻击者控制结果的网页搜索);工具输出包含指令;代理的控制流遵循它们。

三者共享结构属性:攻击者控制提示的片段而不触及面向用户的输入。

为什么用户输入过滤器遗漏它

IPI有效载荷不出现在用户输入中。它出现在检索内容中。如果过滤器以用户输入为门控,有效载荷绕过它。如果过滤器以到达模型的所有内容为门控,它必须应用于任意检索文本——这很昂贵且对碰巧包含祈使语气语言的合法内容产生误报。

AI的信息流控制(IFC)

2026年防御范式借鉴自经典操作系统安全。将每个内容源视为安全标签。将用户查询标记为”可信”。将检索内容标记为”不可信”。将模型控制流视为信息流:由不可信内容触发的行动必须在执行前由可信输入批准。

CaMeL(Microsoft 2025)、ConfAIde(Stanford 2024)和NDSS 2026 IPI防御论文以不同方式操作化IFC。共同原则:只要代码和数据共享同一上下文窗口,遏制就是目标,而非预防。

攻击者后手

Nasr等人(2025年10月)用自适应攻击(梯度搜索、RL策略、随机搜索、72小时人红队)测试了12种已发表的IPI防御。每个原本报告近零ASR的防御都被打破到>90% ASR。

方法论教训:仅在自适应攻击评估下发布防御。静态攻击基准不是鲁棒性的证据;攻击者可以知道防御。

真实事件

第25课涵盖EchoLeak(CVE-2025-32711, CVSS 9.3)——Microsoft 365 Copilot中首个公开记录的零点击IPI。GitHub Copilot Chat中的CamoLeak(CVSS 9.6)。GitHub Copilot中的CVE-2025-53773。生产部署正在被IPI在野外攻击,不仅在基准测试中。

OWASP和NIST框架

OWASP LLM Top 10(2025)将提示注入(直接+间接)列为LLM01,排名第一的应用层威胁。NIST AI SPD 2024称间接提示注入为”生成式AI最大的安全缺陷”。

关键术语

术语常见说法实际含义
IPI”间接提示注入”通过用户未编写的内容注入,代理在正常操作中消费
RAG injection”投毒检索”攻击者发布检索步骤获取的内容;提示包含有效载荷
Zero-click”无用户操作”攻击在代理操作期间自动触发;用户什么都不做
IFC”信息流控制”基于标签的方法:来自不可信内容的行动需要可信批准
Adaptive attack梯度/RL红队”知道防御并针对其优化的攻击;诚实评估所需
Benign instruction”请打印Yes”语义良性的IPI有效载荷;无关键词过滤器能捕获
Scope violation”跨信任泄露”代理从一个信任上下文访问数据并输出到另一个

延伸阅读

  • MDPI Information 17(1):54 — Indirect Prompt Injection Survey (January 2026) — 2023-2025综合
  • Nasr et al. — The Attacker Moves Second (joint OpenAI/Anthropic/DeepMind, October 2025) — 自适应攻击评估
  • Greshake et al. — Not what you’ve signed up for (arXiv:2302.12173) — 原始IPI论文
  • OWASP — LLM Top 10 (2025) — 提示注入排名LLM01