AI产品的数据合规,和传统互联网不在一个量级。传统互联网的数据流转是线性的(采集→存储→使用),而AI产品的数据流转是网状的——训练数据、用户输入、模型输出、API中转、跨境传输,每个环节都有独立的合规要求。
AI产品的5大数据合规风险
风险一:训练数据来源合法性
法规依据: 《生成式人工智能服务管理暂行办法》第七条
生成式人工智能服务提供者应当依法开展预训练、优化训练等训练数据处理活动,遵守以下规定: (一)使用具有合法来源的数据和基础模型; (二)涉及知识产权的,不得侵害他人依法享有的知识产权; (三)涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形; (四)采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性和多样性。
风险场景:
| 数据来源 | 合规风险 | 应对措施 |
|---|---|---|
| 爬取公开网页数据 | 可能侵犯著作权、个人信息 | 审查robots.txt、版权声明、数据中是否含个人信息 |
| 用户生成内容(UGC) | 用户未授权将其内容用于训练 | 用户协议中明确约定数据使用条款,取得同意 |
| 购买第三方数据集 | 数据来源不透明 | 要求供应商提供数据来源证明和授权链路 |
| 开源数据集 | 许可证限制商用 | 逐项审查许可证(CC-BY、Apache 2.0等)的商用限制 |
| 员工自有数据 | 个人信息未取得同意 | 签署知情同意书,明确用途和权利 |
合规要点:
- 建立训练数据资产清单,记录每条数据的来源、获取方式、授权状态
- 对包含个人信息的数据,取得单独同意
- 对有版权保护的数据,取得商用许可
- 保留数据来源证明文件至少3年
风险二:API聚合场景的数据流转
典型场景: 你的产品调用大模型A的API,同时将用户数据传给B做数据处理,再将结果传给C做存储——A→B→C,每段数据流转都有独立的合规责任。
核心问题:每段数据流转的责任如何划分?
| 环节 | 数据处理角色 | 合规义务 |
|---|---|---|
| 你→大模型A | 数据提供方 | 确保用户数据传输已取得同意,签署数据处理协议 |
| 大模型A→B | 大模型A作为处理者 | 审查A的数据处理条款,确认其是否将数据用于训练 |
| B→C | B作为处理者 | 确认B的数据安全措施,签署DPA |
| C存储 | C作为存储方 | 确认数据存储位置、加密措施、留存期限 |
合规要点:
- 在用户协议中明确告知数据将传输给哪些第三方
- 与每个API提供方签署数据处理协议(DPA)
- 审查API提供方的数据处理条款,特别是"是否将用户数据用于模型训练"
- 建立API数据流转图,标注每段流转的合规义务
风险三:模型输出中的个人信息泄露
风险描述: 大模型在训练过程中可能"记住"了训练数据中的个人信息(姓名、电话、身份证号等),当用户提问时,这些信息可能被输出。
法规风险: 违反《个人信息保护法》关于个人信息处理的规定,可能被处以罚款(最高5000万元或上一年度营业额5%)。
应对措施:
- 训练阶段: 对训练数据进行个人信息脱敏处理
- 推理阶段: 部署输出过滤系统,拦截包含个人信息的输出
- 制度层面: 建立"模型输出个人信息泄露"的应急响应机制
- 用户层面: 在隐私政策中告知可能的输出风险,提供投诉渠道
风险四:自动化决策的知情同意
法规依据: 《个人信息保护法》第二十四条
个人信息处理者利用个人信息进行自动化决策,应当保证决策的透明度和结果公平、公正,不得对个人在交易价格等交易条件上实行不合理的差别待遇。 通过自动化决策方式向个人进行信息推送、商业营销,应当同时提供不针对其个人特征的选项,或者向个人提供便捷的拒绝方式。 通过自动化决策方式作出对个人权益有重大影响的决定,个人有权要求个人信息处理者予以说明,并有权拒绝个人信息处理者仅通过自动化决策的方式作出决定。
AI企业高风险场景:
| 应用场景 | 合规要求 |
|---|---|
| AI推荐系统 | 提供不针对个人特征的选项 |
| AI信用评估 | 保留人工复核机制,提供解释 |
| AI招聘筛选 | 不得构成歧视,提供人工复核 |
| AI定价系统 | 不得实行不合理的差别待遇 |
| AI客服系统 | 提供转人工选项 |
合规要点:
- 评估每个自动化决策是否对个人权益有重大影响
- 为重大影响决策提供人工复核机制
- 提供便捷的拒绝自动化决策的入口
- 保留决策逻辑说明,以备监管问询
风险五:数据跨境流动
法规依据: 《数据出境安全评估办法》第四条
需要申报数据出境安全评估的情形:
| 序号 | 适用情形 | 阈值 |
|---|---|---|
| 1 | 向境外提供重要数据 | 无阈值限制 |
| 2 | 关键信息基础设施运营者向境外提供个人信息 | 100万人以上 |
| 3 | 处理100万人以上个人信息的数据处理者向境外提供个人信息 | 100万人以上 |
| 4 | 自上年1月1日起累计向境外提供10万人个人信息 | 10万人 |
| 5 | 自上年1月1日起累计向境外提供1万人敏感个人信息 | 1万人 |
2026年9月最新政策口径(国家网信办《数据出境安全管理政策法规问答》):
- 非关键信息基础设施运营者累计向境外提供10万人以上、不满100万人个人信息(不含敏感)或不满1万人敏感个人信息的,可通过个人信息出境认证方式履行义务
- 不得通过数量拆分等手段将应申报安全评估的数据转为认证方式出境
- 已通过认证但后续累计达到安全评估阈值的,应转为申报安全评估
AI企业高风险场景:
- 调用境外大模型API(如OpenAI),用户数据跨境传输
- 在境外部署模型节点,数据跨境存储
- 跨国企业内部数据跨境共享
- 训练数据中含有境外个人信息
合规检查清单
数据分类分级
| 检查项 | 要求 |
|---|---|
| 是否建立数据分类分级制度 | 《数据安全法》第二十一条要求 |
| 是否有数据资产清单 | 涵盖训练数据、用户数据、员工数据、第三方数据 |
| 重要数据、核心数据、一般数据范围是否明确 | 按危害程度分级 |
| 模型训练数据是否纳入分类分级 | AI企业特有要求 |
告知与同意
| 检查项 | 要求 |
|---|---|
| 是否以显著方式告知处理规则 | 清晰易懂的语言 |
| 是否取得同意 | 特别关注自动化决策、跨境传输 |
| 敏感个人信息是否取得单独同意 | 生物识别、宗教信仰、医疗健康等 |
| 用户协议中是否说明AI训练数据使用 | 明确是否将用户数据用于训练 |
个人信息保护影响评估(PIA)
| 触发情形 | 要求 |
|---|---|
| 处理敏感个人信息 | 应当事先进行PIA |
| 自动化决策 | 应当事先进行PIA |
| 委托处理、共享、公开披露 | 应当事先进行PIA |
| 跨境传输 | 应当事先进行PIA |
| 对个人权益有重大影响 | 应当事先进行PIA |
数据跨境传输
| 检查项 | 要求 |
|---|---|
| 是否识别数据出境场景 | 境外API、境外存储、跨境共享 |
| 是否达到安全评估阈值 | 参照上述4种情形 |
| 是否完成安全评估/认证/标准合同 | 三选一,不可拆分规避 |
| 与境外接收方是否签署法律文件 | DPA或SCC |
第三方合作
| 检查项 | 要求 |
|---|---|
| 是否审查API提供方的数据处理规则 | 特别关注是否将数据用于训练 |
| 是否签署数据处理协议(DPA) | 明确双方责任义务 |
| 是否建立API数据流转图 | 标注每段流转的合规义务 |
合规行动时间表
| 时间节点 | 行动项 | 优先级 |
|---|---|---|
| 第1周 | 建立数据资产清单,完成数据分类分级 | P0 |
| 第1-2周 | 审查隐私政策和用户协议,补充AI训练条款 | P0 |
| 第2-3周 | 评估数据出境场景,确定合规路径 | P0 |
| 第3-4周 | 完成PIA(敏感信息、自动化决策、跨境传输) | P1 |
| 第4-6周 | 与API提供方签署DPA,建立数据流转图 | P1 |
| 第6-8周 | 部署模型输出过滤系统 | P1 |
| 持续 | 建立数据合规审计机制(每半年一次) | P2 |
处罚案例
案例1:江苏某科技公司(2025年) 企业以"API中转站"方式调用多个大模型接口提供AI对话服务,未按规定开展安全评估,存在内容安全风险。网信部门核查后认定违规,对相关企业作出处理。
案例2:Replika GDPR处罚 意大利监管机构对AI聊天机器人Replika背后公司Luka Inc.处以500万欧元行政罚款,涉及GDPR多项规则违规,包括未取得有效同意、未提供充分信息、未进行DPIA等。
本文依据《个人信息保护法》《数据安全法》《数据出境安全评估办法》《生成式人工智能服务管理暂行办法》及2026年9月网信办数据出境政策问答编写。如需AI企业数据合规体系建设服务,请联系 简深律师事务所。