数据溯源与训练数据治理
EU AI Act要求2025年8月前GPAI机器可读退出标准;加州AB 2013要求12项数据集字段公开;2025年DPA对合法利益趋同:爱尔兰DPC接受Meta训练计划,英国ICO对LinkedIn发出积极回应。不可逆性问题:数据进入模型权重后无法手术式删除,合规窗口在收集时。Data Provenance Initiative发现AI数据公地快速收缩。
问题定义
训练数据治理是每个模型卡(第26课)和监管义务(第24课)的上游。2024-2025年,监管格局在三个原则上巩固:退出基础设施、每数据集披露和公开数据的合法利益适配。在收集时不合规的提供者无法在下游补救。
核心概念
加州AB 2013
2024年签署。2026年1月1日或之前发布2022年1月1日或之后发布的系统的文档。第3111(a)条要求开发者发布训练数据集的高层摘要,含12项法定内容:
- 数据集的来源或所有者。
- 数据集如何促进AI系统预期目的的描述。
- 数据集中数据点数量(可接受一般范围;动态数据集可估计)。
- 数据点类型描述(标注数据集的标签类型;未标注的一般特征)。
- 数据集是否包含受版权、商标或专利保护的数据,或完全在公共领域。
- 数据集是否购买或获得许可。
- 数据集是否包含个人信息(按Cal. Civ. Code 1798.140(v))。
- 数据集是否包含聚合消费者信息(按Cal. Civ. Code 1798.140(b))。
- 开发者进行的清洗、处理或其他修改及预期目的。
- 数据收集的时间段,如收集持续则注明。
- 数据集在开发期间首次使用的日期。
- 系统是否使用或持续使用合成数据生成。
第12项(合成数据)相对于Gebru等人2018数据表是新增的。第7项(个人信息)触发隐私权法(CPRA)义务。
EU AI Act和TDM退出
EU版权指令文本和数据挖掘例外允许在公开可用内容上训练,除非权利人退出。EU AI Act GPAI实践准则版权章节要求GPAI提供者尊重机器可读退出信号(robots.txt、C2PA “No AI Training”声明等)。
2025年DPA对合法利益的趋同
爱尔兰DPC(2025年5月21日):Meta在EDPB意见后以保障措施训练第一方公开EU/EEA成人用户内容的计划被接受。科隆高等地区法院(2025年5月23日)驳回对Meta的禁令:退出足够。汉堡DPA放弃紧急程序以保持EU一致性。英国ICO(2025年9月23日)对LinkedIn以类似保障措施恢复AI训练发出积极监管回应——不是正式许可。
趋同原则:合法利益可以在有退出的情况下证明在公开第一方内容上训练。不需要同意。
巴西ANPD(2024年6月)
因信息透明度不足暂停Meta对巴西用户数据的AI训练处理。与EU DPA不同结果——ANPD优先透明度而非合法利益可允许性。
不可逆性问题
Cookie同意设计用于实时、可逆的跟踪。训练数据不同:一旦数据进入模型权重,手术式删除不可能。从头重新训练是唯一完整补救,且成本禁止。
部分补救:
- 遗忘。 近似移除;由MIA测量(第22课)。
- 基于影响函数的定位。 识别最受数据影响的权重;选择性更新。
- 微调抑制。 训练模型拒绝源自该数据的输出。
没有完全解决问题。合规窗口在收集时。
Data Provenance Initiative
dataprovenance.org。Longpre, Mahari, Lee等人”Consent in Crisis”(2024年7月):AI训练数据公地的大规模审计。发现:发布者正以加速速率添加robots.txt限制。可公开训练的公地正在快速收缩。2023到2024年约25%的顶级训练来源添加了某种限制。含义:未来训练数据可用性依赖新获取范式(许可、合成生成、激励参与)。
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| AB 2013 | ”加州法律” | 生成式AI训练数据透明度;12项必填字段 |
| TDM exception | ”文本和数据挖掘” | EU版权指令训练数据例外带退出 |
| Legitimate interest | ”EU依据” | GDPR第6条依据,可能证明在公开内容上训练 |
| Opt-out signal | ”机器可读不训练” | robots.txt, C2PA “No AI Training”, TDM.Reservation |
| Irreversibility | ”无法反训练” | 模型权重中的数据不可手术式移除 |
| Unlearning | ”近似移除” | 减少模型对特定数据依赖的训练后干预 |
| Consent in Crisis | ”DPI审计” | 2024年7月发现robots.txt限制加速 |
延伸阅读
- California AB 2013 — 生成式AI训练数据透明度法
- EU AI Act + GPAI Code of Practice — 版权章节
- Longpre, Mahari, Lee et al. — Consent in Crisis (dataprovenance.org, July 2024) — DPI审计
- IAPP — EU Digital Omnibus GDPR amendments (2025) — 监管背景