前置知识: AI伦理与安全

数据溯源与训练数据治理

00:00
7 min Advanced

EU AI Act要求2025年8月前GPAI机器可读退出标准;加州AB 2013要求12项数据集字段公开;2025年DPA对合法利益趋同:爱尔兰DPC接受Meta训练计划,英国ICO对LinkedIn发出积极回应。不可逆性问题:数据进入模型权重后无法手术式删除,合规窗口在收集时。Data Provenance Initiative发现AI数据公地快速收缩。

问题定义

训练数据治理是每个模型卡(第26课)和监管义务(第24课)的上游。2024-2025年,监管格局在三个原则上巩固:退出基础设施、每数据集披露和公开数据的合法利益适配。在收集时不合规的提供者无法在下游补救。

核心概念

加州AB 2013

2024年签署。2026年1月1日或之前发布2022年1月1日或之后发布的系统的文档。第3111(a)条要求开发者发布训练数据集的高层摘要,含12项法定内容:

  1. 数据集的来源或所有者。
  2. 数据集如何促进AI系统预期目的的描述。
  3. 数据集中数据点数量(可接受一般范围;动态数据集可估计)。
  4. 数据点类型描述(标注数据集的标签类型;未标注的一般特征)。
  5. 数据集是否包含受版权、商标或专利保护的数据,或完全在公共领域。
  6. 数据集是否购买或获得许可。
  7. 数据集是否包含个人信息(按Cal. Civ. Code 1798.140(v))。
  8. 数据集是否包含聚合消费者信息(按Cal. Civ. Code 1798.140(b))。
  9. 开发者进行的清洗、处理或其他修改及预期目的。
  10. 数据收集的时间段,如收集持续则注明。
  11. 数据集在开发期间首次使用的日期。
  12. 系统是否使用或持续使用合成数据生成。

第12项(合成数据)相对于Gebru等人2018数据表是新增的。第7项(个人信息)触发隐私权法(CPRA)义务。

EU AI Act和TDM退出

EU版权指令文本和数据挖掘例外允许在公开可用内容上训练,除非权利人退出。EU AI Act GPAI实践准则版权章节要求GPAI提供者尊重机器可读退出信号(robots.txt、C2PA “No AI Training”声明等)。

2025年DPA对合法利益的趋同

爱尔兰DPC(2025年5月21日):Meta在EDPB意见后以保障措施训练第一方公开EU/EEA成人用户内容的计划被接受。科隆高等地区法院(2025年5月23日)驳回对Meta的禁令:退出足够。汉堡DPA放弃紧急程序以保持EU一致性。英国ICO(2025年9月23日)对LinkedIn以类似保障措施恢复AI训练发出积极监管回应——不是正式许可。

趋同原则:合法利益可以在有退出的情况下证明在公开第一方内容上训练。不需要同意。

巴西ANPD(2024年6月)

因信息透明度不足暂停Meta对巴西用户数据的AI训练处理。与EU DPA不同结果——ANPD优先透明度而非合法利益可允许性。

不可逆性问题

Cookie同意设计用于实时、可逆的跟踪。训练数据不同:一旦数据进入模型权重,手术式删除不可能。从头重新训练是唯一完整补救,且成本禁止。

部分补救:

  • 遗忘。 近似移除;由MIA测量(第22课)。
  • 基于影响函数的定 识别最受数据影响的权重;选择更新
  • 微调抑制。 训练模型拒绝源自该数据的输出

没有完全解决问题。合规窗口在收集时。

Data Provenance Initiative

dataprovenance.org。Longpre, Mahari, Lee等”Consent in Crisis”(2024年7月):AI训练数据公地的大规模审计。发现发布者正以加速速添加robots.txt限制。可公开训练的公地正在快速收缩。2023到2024年约25%的顶级训练添加了某种限制。含义:未来训练数据可用性依赖新获取范式(许可、合成生成、激励参与)。

关键术语

术语常见说法实际含义
AB 2013”加州法律”生成式AI训练数据透明度;12项必填字段
TDM exception文本和数据挖掘”EU版权指令训练数据例外带退出
Legitimate interest”EU依据”GDPR第6条依据,可能证明在公开内容训练
Opt-out signal机器可读不训练robots.txt, C2PA “No AI Training”, TDM.Reservation
Irreversibility”无法反训练模型权重中的数据不可手术式移除
Unlearning”近似移除”减少模型特定数据依赖训练干预
Consent in Crisis”DPI审计”2024年7月发现robots.txt限制加速

延伸阅读

  • California AB 2013 — 生成式AI训练数据透明度法
  • EU AI Act + GPAI Code of Practice — 版权章
  • Longpre, Mahari, Lee et al. — Consent in Crisis (dataprovenance.org, July 2024) — DPI审计
  • IAPP — EU Digital Omnibus GDPR amendments (2025) — 监管背景

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式