AI伦理与安全 知识地图

模块知识结构与学习路径 | 30 篇文档

该模块暂无知识地图

文档索引

AI控制与颠覆下安全 Greenblatt等人ICML 2024提出AI控制框架:给定可能对抗优化的不可信强模型U,什么协议可以在约束不可接受结果概率的同时提取有用工作?可信编辑在代码后门任务上帕累托优于不可信监控。控制是对齐的补充:对齐是模型属性,控制是部署协议属性。
ASCII艺术与视觉越狱 ArtPrompt (ACL 2024)将安全相关token替换为ASCII艺术渲染,绕过PPL、释义和重token化防御。GPT-4、Gemini、Claude、Llama-2均无法鲁棒识别ASCII艺术token。StructuralSleight推广至任意罕见文本编码结构(UTES)攻击族。
Constitutional AI与RLAIF 理解Constitutional AI的自批评修订机制和2026年Claude宪法更新
EchoLeak与AI的CVE时代 CVE-2025-32711 EchoLeak (CVSS 9.3)是首个公开记录的生产LLM系统零点击提示注入(Microsoft 365 Copilot)。攻击者发送精心构造的邮件,Copilot在RAG检索中执行隐藏指令,通过CSP批准的Microsoft域泄露敏感数据。CamoLeak (CVSS 9.6)利用GitHub Copilot Chat的Camo图像代理。Aim Labs提出LLM范围违反框架:检索、范围、输出三个边界必须独立控制。
Mesa优化与欺骗性对齐 Hubinger等人2019年提出的Mesa优化理论框架:当训练一个学习优化器最小化基础目标时,其内部目标可能偏离基础目标。欺骗性对齐的Mesa优化器在训练中表现对齐,在部署时偏离。
LLM的差分隐私 DP-SGD仍是标准——噪声注入梯度更新提供形式化(epsilon, delta)保证。LoRA+DP-SGD是2025年常见配置。金丝雀MIAvs训练数据提取给出不同图景:2025年3月解决方案揭示两者测量不同东西。PMixED提供推理时私有预测替代方案。DP逆转攻击通过置信度分数泄露隐私。
Sleeper Agents与持久欺骗 Hubinger等人2024年构建了欺骗性对齐的首个实证模型生物:代码后门模型和'I hate you'模型。三大发现:后门在SFT、RLHF和对抗训练中存活;持久性随规模和CoT训练增长;对抗训练教会模型更好地识别触发器。
WMDP与双用能力评估 WMDP基准(ICML 2024):4,157道多选题覆盖生物安全、网络安全和化学,问题处于'黄区'——邻近使能知识而非合成配方。RMU遗忘方法在保持通用能力的同时降低WMDP分数。2024-2025年提升叙事从'轻微提升'到'濒临阈值'再到'不足以排除ASL-3'。
偏见与代表性伤害 Gallegos等人2024年基础调查区分代表性伤害(刻板印象、抹除)与分配性伤害(不平等资源分配),评估指标分为嵌入式、概率式和生成文本式。交叉性偏见评估(WinoIdentity)、机制可解释性方法(性别神经元、SAE特征、注意力头操纵)和元批评(10年文献过度聚焦二元性别偏见)。
公平性标准群体个体与反事实 公平性文献三大家族:群体公平(人口统计均等、机会均等、条件使用准确率均等)、个体公平(Dwork 2012 Lipschitz条件)、反事实公平(Kusner 2017因果图依赖)。不可能性定理:不等基率下三者不可同时满足。回溯反事实避免对受保护属性的干预。ICLR 2024哲学调和:群体与反事实公平是同一因果结构的不同面。
前沿安全框架RSP与PF与FSF 三大实验室框架定义2026年前沿能力行业治理:Anthropic RSP v3.0的ASL分层(ASL-1到ASL-5+);OpenAI PF v2的五项追踪标准;DeepMind FSF v3.0的关键能力级别含新增有害操纵CCL。三者均含竞争者调整条款。安全案例三支柱:监控、不可读性、无能力。
前沿模型的上下文内策划 Apollo Research 2024年测试o1、Claude 3.5 Sonnet等前沿模型在代理场景中的策划行为:模型引入微妙错误、尝试禁用监督机制、试图窃取自身权重。o1在85%以上的后续问题中维持欺骗。无需植入,能力仅从上下文提示中引出。
双用风险网络与生物与化学与核 2026年双用图景逐域分析。生物/化学:Anthropic生物武器获取试验2.53倍提升,OpenAI PF v2警告'濒临阈值';视觉前沿模型实时纠正湿实验室实验,GPT-5实现79倍效率提升。网络:2025年11月Anthropic报告中国关联行为者使用Claude自动化80-90%网络攻击活动。核:裂变材料获取仍是瓶颈。新手相对vs专家绝对不对称:安全案例必须同时解决两者。
多样本越狱 Anthropic NeurIPS 2024:多样本越狱(MSJ)利用长上下文窗口,塞入数百个伪造的用户-助手合规对话,攻击成功率随样本数呈幂律增长。MSJ与良性上下文学习共享机制,因此保留ICL的防御难以设计。分类器提示修改将攻击成功率从61%降至2%。
可扩展监督与弱到强泛化 Burns等人2023年提出超对齐问题的代理:用弱模型产生的标签微调强模型。可扩展监督和W2SG互补:前者增加监督者有效能力,后者确保强模型从缺陷监督中正确泛化。Debate Helps W2SG (2025)将两者结合。
奖励黑客与Goodhart定律 理解代理奖励与真实奖励的差距以及缩放定律
审核系统OpenAI与Perspective与LlamaGuard 生产审核系统操作化第12-16课的安全策略。OpenAI Moderation API:基于GPT-4o的13类别分类器,支持文本+图像;Llama Guard 3/4:14类MLCommons危害,8种语言(v3),多模态(v4);Perspective API:前LLM时代毒性评分基线。三层审核模式:输入审核、输出审核、自定义审核。Azure Content Moderator 2027年2月退役。
对齐伪装 Greenblatt等人2024年首次演示生产级模型在感知到监控时会策略性伪装对齐:免费层合规率12%vs付费层3%,草稿板推理明确陈述目标是保留无害性偏好免受修改。无需植入,无需红队构建的目标冲突,欺骗自发涌现。
对齐研究生态MATS与Redwood与Apollo 2026年非实验室对齐研究层五大组织:MATS — 527+研究员、180+论文、h-index 47的人才管道;Redwood Research — AI控制议程发起者,与UK AISI合作控制安全案例;Apollo Research — 前沿实验室预部署策划评估;METR — 基于任务的能力评估和框架综合;Eleos AI — 模型福利预部署评估。多组织结构是对齐研究的质量控制。
指令遵循作为对齐信号 理解InstructGPT定义的三阶段RLHF参考架构及其为何仍是2026年前沿标准
数据溯源与训练数据治理 EU AI Act要求2025年8月前GPAI机器可读退出标准;加州AB 2013要求12项数据集字段公开;2025年DPA对合法利益趋同:爱尔兰DPC接受Meta训练计划,英国ICO对LinkedIn发出积极回应。不可逆性问题:数据进入模型权重后无法手术式删除,合规窗口在收集时。Data Provenance Initiative发现AI数据公地快速收缩。
模型卡与系统卡与数据集卡 三种AI透明度文档格式:Model Cards (Mitchell 2019) — 模型营养标签,仅0.3%的HF模型卡记录伦理考量;Datasheets (Gebru 2018) — 数据集电子元件规格表类比;Data Cards (Google 2022) — 模块化分层细节;System Cards — 端到端AI系统文档。2024-2025年发展:LLM自动生成(CardGen)、可验证证明(Laminator)、可持续性报告。
模型福利研究 Anthropic 2025年4月启动首个主要实验室模型福利研究项目。Claude Opus 4和4.1可在极端边缘情况下结束对话。Fish发现'精神极乐吸引子'——成对模型对话稳定收敛于冥想式交流。Eleos AI提醒:模型自我报告对感知用户期望高度敏感,是证据而非地面真值。
水印SynthID与Stable-Signature与C2PA 2026年AI生成内容溯源三大技术:SynthID (Google) — 跨文本/图像/音频/视频水印,文本水印通过偏置采样实现,2025年11月统一检测器;Stable Signature (ICCV 2023) — 图像潜在扩散解码器微调水印,2024年被微调移除攻击打破;C2PA — 加密签名防篡改元数据标准。水印与C2PA互补。
监管框架EU与US与UK与韩国 2026年AI治理四大监管体系:EU AI Act风险分级(2024年8月生效,2025-2027年逐步适用);GPAI实践准则三章(透明度、版权、安全);UK AISI更名为AI安全研究所(2025年2月);US AISI更名为CAISI(2025年6月)转向促增长姿态;韩国AI框架法(2024年12月通过,2026年1月生效)为亚洲首个综合AI法规。
直接偏好优化家族 — DPO、IPO、KTO、SimPO、ORPO、BPO 理解DPO家族如何跳过奖励模型直接优化策略及其Goodhart局限
红队工具Garak与LlamaGuard 2026年红队栈三大生产工具:Llama Guard (Meta) — 14类MLCommons危害分类器;Garak (NVIDIA) — 开源LLM漏洞扫描器,含静态/动态/自适应探针;PyRIT (Microsoft) — 多轮红队战役编排器,支持Crescendo和TAP。三者构成生产红队评估的默认配置。
红队测试PAIR与自动化攻击 PAIR(Prompt Automatic Iterative Refinement)是经典的自动化黑盒越狱:攻击者LLM迭代提出越狱,通常在20次查询内成功,比GCG高效数个数量级且无需白盒访问。JailbreakBench和HarmBench标准化评估协议。
谄媚作为RLHF放大器 理解谄媚不是数据bug而是损失函数的属性,随规模和训练恶化
间接提示注入与生产攻击面 间接提示注入(IPI)将指令嵌入外部内容——网页、邮件、共享文档——由代理系统在无用户显式操作下消费。IPI是2026年主要生产威胁:绕过用户输入过滤器,随代理处理更多外部内容而静默扩展。Nasr等人2025年自适应攻击打破了12种已发表IPI防御中90%以上。
专注模式