
导语
2026年7月20日,美国法院批准Anthropic与作者方的和解协议:约48万部作品,每部赔偿约3000美元,合计约15亿美元[1]。同月早些时候,纽约时报、纽约每日新闻等多家媒体在诉OpenAI案中提交制裁动议,指控对方在诉讼中隐瞒并销毁了数百万条对话记录(原告单方主张,尚未经法院认定)[2]。 国内这边,“剑网2026”专项行动把AI训练语料版权合规列为四个重点领域之一[3];上海首例AI大模型著作权案二审宣判,第一次系统回答了"拿别人作品训模型算不算侵权"[4]。 训练数据这一关,国内外监管同时收紧。你的语料库,经得起查吗?
先说结论:数据合不合规,看两件事
训练数据的法律风险,取决于两件事:来源合不合法,手段干不干净。
按获取方式,训练数据分五大来源,风险等级完全不同:
数据来源 | 风险等级 | 核心合规要点 |
公开数据爬取 | ⚠️中高 | 遵守robots协议、不绕过技术措施、注意数据里有没有个人信息 |
授权采购 | ✅ 低 | 合同要"来源合法性保证"条款,但自己也要尽调 |
用户生成内容(UGC) | ⚠️高 | 按PIPL分层取得同意,敏感信息须"单独同意" |
他人版权作品 | ❌ 高 | 中国法合理使用是封闭列举,"训练"不在列举内 |
蒸馏其他模型 | ⚠️高(分场景) | 分场景评估:使用条款禁止没?是不是竞争性蒸馏? |
一句话:"数据是网上公开的"和"数据是能用的",是两个问题。前一个问题决定你能不能拿到数据,后一个问题决定你会不会被追责。
支撑这些判断的底层规则,主要是《生成式人工智能服务管理暂行办法》第七条的五项要求(合法来源、知识产权、个人信息、数据质量、其他法律)[5]——训练数据合规的"基本法"。
四个误区,先纠偏
误区一:"公开数据就是可以随便用的数据。"
公开≠免费可用。知乎问答、公众号文章、豆瓣书评,都公开,但都受著作权保护。robots协议、网站服务条款、版权声明,都可能对使用施加限制。"公开"只解决了"能不能看到",没解决"能不能用"。
误区二:"用户协议里写一句'平台有权使用用户内容'就够了。"
PIPL对同意的要求分两层[6]:普通个人信息,按第十三条识别处理基础,以同意为基础的,须由用户在充分知情的前提下自愿、明确作出(第十四条);敏感个人信息(人脸、健康、金融等),第二十九条进一步要求"单独同意"——不能混在用户协议长文本里,不能与其他事项捆绑。
用户协议里那句泛化授权,既证明不了用户对"用于模型训练"这个具体目的充分知情,更过不了敏感信息的"单独同意"关。
误区三:"蒸馏不复制代码,所以不侵权。"
蒸馏确实不复制源代码,但这不代表没有法律风险。教师模型的使用条款禁止蒸馏的,构成合同违约;蒸馏直接竞争对手的能力用于竞争,可能构成不正当竞争。2026年,Anthropic已经两次公开点名中国厂商(详见下文)。蒸馏是不是问题,取决于场景,不是取决于"复制没复制代码"。
误区四:"数据是采购的/标注是外包的,出了事找供应商/外包公司。"
都不行。采购方"知道或应当知道"数据来源有问题(比如价格低得离谱、数据量大得不合理)的,仍可能承担共同侵权责任;标注义务在《暂行办法》第八条,落在AI服务提供者身上,外包转移的是执行,不是责任[5]。合同条款是必要的,但不是充分的——你还得做自己的尽调和抽检。
爬虫的刑事红线:三个真实判例
爬虫是国内AI企业取数最常用的方式,也是刑事风险最高频的环节。三个真实判例,看懂数据获取在什么情况下从"民事侵权"升级成"刑事犯罪"。
先说规则。《刑法》第二百八十五条的非法获取计算机信息系统数据罪,核心要件是"侵入"或"采用其他技术手段"获取数据[7]。但"可能构成"不等于"一律构成"——是否入罪,须逐项看手段、数据性质、数量、违法所得和主观明知。仅凭"绕过了验证码"或"爬的是公开页面",推不出有罪,也推不出无罪。
三个判例:
判例 | 案情 | 信号 |
长宁爬虫案 | 外部团伙微信群"接单"层层转包:上游以0.4元/条收购,团伙以0.36元/条转包抓取,绕过验证码爬取商品数据11万余条,违法所得4.4万余元,4人分别获刑9个月至1年2个月[8] | 绕过反爬措施+出售牟利,数据"公开可见"救不了你 |
静安越权案 | 数据公司人员用临时账号超越授权范围、避开下载限制,取企业数据1800余万条,判处有期徒刑三年、缓刑,并处罚金[9] | 有合法账号也可能入罪——"超越授权"就是红线 |
普陀木马案 | 二人伪装求职者投递藏木马的简历,侵入证券咨询公司内网,把60余万行脱敏股民数据还原成完整个人信息,各判3年[10] | 木马+爬虫,从"爬"升级为"侵入",最危险形态 |
三个案子有一个共同点:定罪的关键都不是"数据本身违不违法",而是"获取手段干不干净"。
顺带一个提醒:长宁案的被告是卖数据的网络团伙,不是AI企业——但反过来看,如果你从数据倒卖渠道采购语料,买到手很可能就是这类团伙的产物。所以采购尽调不是走过场。爬虫采集还应一并对照《网络数据安全管理条例》第十八条、第十九条对自动化收集和AI训练数据处理的要求[11]。
用户数据能不能拿去训练:分层看
这是AI企业最纠结的问题:用户在我平台上产生的对话内容,能不能拿去训下一代模型?
分层判断:
数据类型 | 同意要求 |
普通个人信息 | 按第十三条识别处理基础(同意只是其一);以同意为基础的,就"用于模型训练"这一具体目的,向用户清晰告知,取得充分知情、自愿明确的同意 |
敏感个人信息 | "单独同意"(第二十九条)+加密脱敏+限定知悉范围+PIA评估[6] |
不含个人信息的内容 | 不适用PIPL同意规则,但仍受平台与用户的合同约定约束 |
两个实务要点:
一,"一揽子同意"两头不讨好。把训练目的和服务改进、产品优化混在用户协议一句话里——含敏感信息时不符合"单独同意",不含时也难以证明"充分知情"。合规做法:就训练这一件事,单独、清晰告知,用户主动勾选确认,不默认勾选。
二,OpenAI的API/网页端区别,不是法定分类。OpenAI对API用户默认不训练(可主动加入)、网页端默认训练(可退出),这是厂商自己的产品和商业策略安排,可作设计参考,但不能直接等同于PIPL的法律要求。
配套的退出(opt-out)机制:入口要找得到、退出要即时生效、退出不影响服务。用户退出后,已训练进模型的数据能不能"精确删除",取决于技术实现——实务常见做法是承诺新数据不再用于训练、下轮迭代不再使用该用户数据。
蒸馏:
蒸馏本身是可合法使用的技术。风险不在技术,在场景:
风险 | 触发条件 |
合同违约 | 所用模型的服务条款禁止蒸馏(OpenAI、Anthropic等主流厂商条款均有限制),违约即面临终止服务和追责 |
不正当竞争 | 蒸馏直接竞争对手的能力并用于竞争,须结合竞争关系、手段、损害判断 |
商业秘密 | 以不正当手段获取模型核心秘密信息 |
声誉风险 | 被公开点名指控 |
已经发生了什么:
时间 | 事件 |
2026年2月 | Anthropic官方公告指控DeepSeek、月之暗面、MiniMax蒸馏Claude能力,涉及超1600万次API交互(厂商单方表述)[12] |
2026年6月 | 据路透社等媒体报道,Anthropic致信美国参议员,指控通义千问相关运营者,涉及超2880万次交互、近2.5万个账户——信件原文未公开,目前属厂商单方指控[13] |
实务建议不是"别做"两个字,而是分场景:先核对服务条款禁止不禁止;再评估是不是针对直接竞争对手的竞争性蒸馏;避免接触对方商业秘密;技术方案留痕证明合规意图。高风险场景排除不掉的,审慎决策。
版权这关:15亿美元买来的教训
Anthropic案:区分"获取"和"训练"。Bartz v. Anthropic案,Anthropic从盗版书库LibGen和PiLiMi下载超过700万部作品建"中央图书馆"(其中约48万部最终纳入和解范围),2026年7月法院批准和解:总额约15亿美元,每部约3000美元,认领率92.77%,分四期支付,销毁盗版文件[1]。一个容易被忽略的细节:法院区分了"获取"和"训练"两个环节——下载盗版书构成侵权(和解解决这一端),训练是否构成合理使用是另一个独立问题,并未被和解否定或确认。数据来源这一端的账,已经算到了15亿美元。
纽约时报案:还在打,但信号已经很强。NYT诉OpenAI案的核心争议是训练是否构成合理使用;2026年7月,纽约时报、纽约每日新闻等多家媒体提交制裁动议,指控OpenAI隐瞒并销毁数百万条对话记录(原告主张,未经法院认定)[2]。对美国判例不必照搬,但中国企业用海外版权作品训练,同样面临被权利人在中国法院起诉的风险。
为什么中国法下抗辩空间有限?《著作权法》第二十四条的合理使用是封闭列举式,"AI模型训练"不在列举范围内[14]。未经授权使用版权作品训练,很难直接援引合理使用抗辩。
上海首例AI大模型案:国内法院的答案。2026年4月二审宣判[4],三个要点:把作品输入LoRA模型训练,只有模型输出再现了原作品,才构成复制权侵权;平台有审核机制、举报通道并及时处置的,不承担连带责任;AI生成内容缺乏人的实质性智力投入的,不认定为作品。个案裁判,不代表全国统一规则,但这是目前国内最系统的裁判表述。
顺带一提印度:德里高等法院在ANI诉OpenAI案中初步认定训练构成合理使用[15]——不同法域,结论可能完全相反。别拿对自己有利的那个法域当全球规则。
监管正在做什么
"剑网2026"专项行动:2026年5月22日启动,四部门联合,AI领域版权整治列为四个重点领域之一,官方表述为"推动解决大模型训练语料版权合规问题"——未经授权用作品训模型、大规模爬取版权内容等行为,可以理解为属于重点整治方向[3]。
"清朗·整治AI应用乱象":截至2026年7月第一阶段,累计处置违规AI产品1.4万余款[16]。处置原因按官方口径包括未履行备案登记、审核过滤不足、数据投毒、标识不到位。这个数字不是"备案产品"数量,是"被处置"数量——监管覆盖面远超备案名单。
《公安机关网络空间安全监督检查办法》(公安部令第176号):2026年8月7日发布,10月1日才施行,施行后公安检查对象扩展至数据处理者、个人信息处理者,检查内容新增数据安全和个人信息保护义务,县级公安可约谈数据处理者[17]。训练数据来源合法性和个人信息合规,即将正式进入公安日常检查视野——但公安检查在法定权限内进行,行业监管仍以行业主管部门为主。
企业可以先做的六项自查
(1)语料来源盘过一遍吗?爬的、买的、用户产生的、蒸馏的,分来源建档——来源不同,风险规则完全不同
(2)爬虫踩线了吗?robots协议遵守没?技术措施绕没绕?爬的数据里有没有个人信息?
(3)用户授权够格吗?用户协议里那句"平台有权使用用户内容"——普通个人信息过不了"充分知情"关,敏感个人信息过不了"单独同意"关
(4)采购合同有保护吗?"数据来源合法性陈述与保证"+indemnity条款+来源证明文件,三样齐了吗?价格低得离谱的语料,敢不敢买?
(5)标注环节谁负责?外包合同里写清标注规则、质量标准、数据安全要求了吗?外包结果抽检了吗?
(6)经得起查吗?每批数据的来源、采集时间、授权文件有没有台账?溯源台账是备案审查和公安检查都会看的材料
律师观点:接下来监管会往哪走
以下为笔者基于2025-2026年执法动态的个人观察,仅供参考。
第一,版权成本从"下架道歉"进入"真金白银"阶段。15亿美元的和解金额,加上剑网2026把训练语料列入执法重点,"被发现了删掉就行"的时代过去了。传统的一对一授权满足不了AI的海量需求,预计版权集体管理组织的批量许可机制会逐步建立——训练数据的"正版化采购"通道,会先在头部企业落地。
第二,个人信息执法从"收集"向"使用"延伸。过去PIPL执法盯的是收集环节,接下来会盯"已收集的数据拿去训练,同意到位没有"。公安176号令10月1日施行后,公安机关在监督检查中即可发现并处置训练数据中的个人信息问题,不再是网信部门单线执法。用户数据训练的同意机制,建议现在就按分层规则重检一遍。
第三,训练数据溯源将成为标配。备案审查问"数据哪来的",公安检查也问"数据哪来的"。三项训练数据推荐性国标已于2025年11月实施,监管追问的技术语言已经准备好了。现在建台账是低成本动作,等检查来了再补,成本完全不是一个量级。
一句话总结:训练数据合规不看你用了多少数据,看你能不能说清楚每一批数据从哪来、怎么拿的、凭什么用。
往期回顾
百宸观点 | 你的AI产品备案了吗? ——5个最常见的认知误区和2026年最新执法动态
百宸观点 | 你的用户数据“出国”了吗? ——AI产品最容易误判的3个数据出境问题
百宸观点 | Claude/GPT到底能不能给中国企业用?——5个变量和3条务实路径
下期预告
训练数据的故事讲完了。按理说,该喘口气了——很多企业确实松了一口气:我们用的不是爬来的数据,用的是开源模型,Llama、Qwen、DeepSeek,官网免费下载,还谈什么合规?
免费下载,不等于免费商用。
开源协议里藏着哪些商用限制?拿开源模型微调出的权重,归你还是归社区?在开源模型上二次训练出的合规问题,责任算谁的?
下一期,我们聊聊那个"看起来最安全"的选项——
开源模型,真的开源到可以拿去卖吗?
主要参考资料:
[1] Bartz v. Anthropic案和解协议获批(2026年7月20日,美国加州北区联邦地区法院),据路透社等媒体报道
[2] 纽约时报、纽约每日新闻等多家媒体诉OpenAI案制裁动议(2026年7月9日提交),原告动议文件及媒体报道
[3] 国家版权局等四部门:"剑网2026"专项行动(2026年5月22日启动),国家版权局官网
[4] 上海知识产权法院:上海首例AI大模型著作权侵权案二审判决(2026年4月29日)
[5] 《生成式人工智能服务管理暂行办法》(2023年7月),国家网信办等七部门,第七条、第八条
[6] 《个人信息保护法》(2021年11月施行),第十三条、第十四条、第二十九条
[7] 《刑法》第二百八十五条(非法获取计算机信息系统数据罪)
[8] 上海长宁区法院:乐某某等4人爬取电商平台商品数据案(2026年1月公诉、6月宣判),据上观新闻(2026年6月16日)、新闻晨报等报道(细节以裁判文书为准)
[9] 上海市静安区人民检察院:《聚焦建设"五个中心"·静安检察|网络检察护航国际城区数字安全》及"1800万条数据被爬"案通报(2025年1月公诉、2025年6月一审宣判),上海检察官网
[10] 上海普陀区法院:"简历藏木马"侵犯股民数据案(2026年6月宣判),据中新网、经济日报等报道
[11] 《网络数据安全管理条例》(2025年1月施行),第十八条、第十九条
[12] Anthropic官方公告:关于蒸馏检测的声明(2026年2月),Anthropic官网
[13] Anthropic致美国参议员信件相关报道(2026年6月),路透社等媒体
[14] 《著作权法》(2021年修正),第二十四条
[15] 印度德里高等法院:ANI v. OpenAI临时禁令裁决(2026年7月24日)
[16] 中央网信办:《"清朗·整治AI应用乱象"专项行动第一阶段工作》(2026年7月6日),网信办官网
[17] 《公安机关网络空间安全监督检查办法》(公安部令第176号,2026年8月7日发布,10月1日施行)
[18] GB/T 45652—2025《网络安全技术 生成式人工智能预训练和优化训练数据安全规范》、GB/T 45654—2025《网络安全技术 生成式人工智能服务安全基本要求》、GB/T 45674—2025《网络安全技术 生成式人工智能数据标注安全规范》(均2025年4月25日发布、2025年11月1日实施,全国网络安全标准化技术委员会归口)
本文内容基于截至2026年8月的最新法规和执法实践整理,仅供参考,不构成正式法律意见。具体合规方案请结合企业实际情况咨询专业律师。
作者介绍