生成式AI暂行办法
训练大模型的语料从哪来才算合法?
依据:《生成式人工智能服务管理暂行办法》
结论:该办法第七条要求提供者依法开展预训练、优化训练等训练数据处理活动,三条底线是:使用具有合法来源的数据和基础模型;涉及知识产权的不得侵害他人依法享有的知识产权;涉及个人信息的应当取得个人同意或者符合法律、行政法规规定的其他情形。另需提高训练数据的真实性、准确性、客观性、多样性。
你可能要做的
- 建立语料台账,逐批登记来源与授权凭据
- 对含个人信息的语料做去标识化或取得同意
- 筛查语料中的版权作品并保留授权文件
- 制定标注规则并抽样核验标注准确性
- 对标注人员开展合规培训并留档
- 基础模型同样核验来源合法性
条文依据
《生成式人工智能服务管理暂行办法》 第七条
(一)使用具有合法来源的数据和基础模型;
《生成式人工智能服务管理暂行办法》 第七条
(二)涉及知识产权的,不得侵害他人依法享有的知识产权;
《生成式人工智能服务管理暂行办法》 第七条
(三)涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形;
一句话结论
语料合不合规,不是看「网上能不能搜到」,而是看三件事:来源是否合法、有没有侵害他人知识产权、涉及个人信息的是否取得同意或符合法定情形。这三条是《生成式人工智能服务管理暂行办法》第七条给训练数据画出的底线。
依据
第七条要求提供者依法开展预训练、优化训练等训练数据处理活动,并列出五项规定。其中三项是最容易被追问的:
第一项,使用具有合法来源的数据和基础模型。注意这里不止管数据,也管基础模型——拿一个来路不明的开源权重去做二次训练,同样有问题。
第二项,涉及知识产权的,不得侵害他人依法享有的知识产权。语料里存在他人作品,并不等于可以随意使用,需要能说明使用依据。
第三项,涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形。这里的关键是「或者其他法定情形」,也就是说不必然只有同意一条路,但要能落到具体法律依据上。
第四项要求采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性、多样性。第五项是兜底:网络安全法、数据安全法、个人信息保护法等其他有关规定和主管部门监管要求同样适用。
此外,第八条对数据标注单独提了要求:在研发过程中进行数据标注的,提供者应当制定清晰、具体、可操作的标注规则,开展标注质量评估、抽样核验标注内容准确性,并对标注人员进行必要培训。
你要做什么
- 建语料台账。每一批数据记四件事:来源渠道、获取方式、授权凭据、是否含个人信息。没有台账,被检查时无法举证。
- 对含个人信息的语料做一次分类:能取得同意的取得同意,不能取得的确认属于哪一类法定情形,并留下判断依据。
- 对含他人作品的语料保留授权文件;没有授权的评估是否属于合理使用范围,无法说明来源的优先从训练集中剔除。
- 把标注规则写成文档。规则要具体到标注什么、什么算合格、抽检比例和返工流程。
- 对标注人员做培训并留记录,培训内容围绕守法意识和规范操作。
- 基础模型的来源、许可协议一并归档,特别是商用限制条款。
容易踩的坑
- 把「公开可访问」当成「可自由用于训练」。公开可访问和可以商用训练是两件事。
- 只查数据不查模型。第七条第一项把基础模型和数据放在同一条里。
- 标注外包后不闻不问。第八条把标注规则、质量评估、人员培训的义务放在提供者身上,外包不免责。
- 只做一次性审查。语料是持续补充的,台账要跟着更新。
常见追问
网上爬的公开数据能直接用来训练吗? 需要证明来源合法,并评估是否侵害他人知识产权、是否包含个人信息。公开可访问不等于可任意用于模型训练。
数据标注外包给第三方,出了问题是外包方担责吗? 第八条规定的义务主体是提供者。标注规则制定、质量评估、人员培训由提供者负责,外包不转移这套义务。
开源模型可以商用吗? 要看具体许可协议。第七条要求使用具有合法来源的基础模型,来源合法性里就包含许可条件是否满足商用场景。
常见追问
- 语料里有别人的文章,一定要拿到授权吗?
- 第七条的要求是不得侵害他人依法享有的知识产权。要么取得授权,要么能说明属于法律允许的使用情形,判断依据要留档备查。
- 用户对话记录能拿来继续训练吗?
- 涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形。用户输入信息还受第十一条保护,不能随意留存和挪作他用。
- 数据质量怎么算达标?
- 第七条要求采取有效措施提高训练数据质量,增强真实性、准确性、客观性、多样性。落地做法是建立可核查的清洗与抽检流程,而不是口头说明。