生成式AI暂行办法
AI生成违法违规内容,平台要怎么防?
依据:《生成式人工智能服务管理暂行办法》
结论:该办法第四条禁止生成危害国家安全、煽动分裂、宣扬恐怖主义极端主义、宣扬民族仇恨歧视、暴力淫秽色情以及虚假有害信息等法律、行政法规禁止的内容,并要求防止歧视。第九条明确,提供者依法承担网络信息内容生产者责任,履行网络信息安全义务,防护需贯穿算法设计、训练数据选择、模型优化和提供服务全流程。
你可能要做的
- 建立生成内容的分类审核与拦截规则
- 对高风险提问设置拒答与转人工策略
- 在模型优化环节持续补充安全样本
- 保留生成与拦截日志以备检查
- 定期回扫生成内容做抽样评估
条文依据
《生成式人工智能服务管理暂行办法》 第四条
提供和使用生成式人工智能服务,应当遵守法律、行政法规,尊重社会公德和伦理道德,遵守以下规定:
《生成式人工智能服务管理暂行办法》 第四条
(一)坚持社会主义核心价值观,不得生成煽动颠覆国家政权、推翻社会主义制度,危害国家安全和利益、损害国家形象……
《生成式人工智能服务管理暂行办法》 第九条
提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务。
一句话结论
AI 生成内容出了问题,责任不会因为「是模型自己生成的」而消失。《生成式人工智能服务管理暂行办法》第九条把提供者定性为网络信息内容生产者,第九条第一句给了定性,第四条给了具体不能生成什么。
依据
第四条要求提供和使用生成式人工智能服务时遵守法律、行政法规,尊重社会公德和伦理道德,并列出五项要求。第一项是核心负面清单:不得生成煽动颠覆国家政权、推翻社会主义制度,危害国家安全和利益、损害国家形象,煽动分裂国家、破坏国家统一和社会稳定,宣扬恐怖主义、极端主义,宣扬民族仇恨、民族歧视,暴力、淫秽色情,以及虚假有害信息等法律、行政法规禁止的内容。
第二项要求防止歧视,且范围覆盖全流程:算法设计、训练数据选择、模型生成和优化、提供服务等过程中,都要采取有效措施防止产生民族、信仰、国别、地域、性别、年龄、职业、健康等歧视。
第五项要求基于服务类型特点采取有效措施,提升服务的透明度,提高生成内容的准确性和可靠性。
第九条给出责任定性:提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务。这意味着安全义务不是选做项,而是提供者的身份自带义务。
你要做什么
- 建立内容安全策略。分层处理:明显违规的直接拒绝生成,灰区内容降级或转人工,正常内容放行。
- 把第四条第一项的负面清单转成可执行的拦截规则集,而不是停留在制度文件里。
- 对高风险场景(政务、医疗、金融、新闻资讯)单独收紧策略,因为这些领域对准确性和可靠性的要求更高。
- 在模型优化环节持续补充安全样本,把线上发现的问题回流到训练和策略中。
- 留存生成内容与拦截记录,用于事后复盘和应对检查。
- 定期抽样回扫,检查策略是否出现漏网或误杀。
容易踩的坑
- 只做输入关键词过滤。绕过方式很多,输出侧同样要有检查。
- 把内容安全交给模型厂商就完事。第九条的责任主体是提供服务的提供者。
- 忽略歧视问题。第四条第二项把歧视防治写到了算法设计、训练数据选择等环节。
- 缺少记录。无法说明采取了哪些措施,等同于没有措施。
常见追问
用户故意诱导,生成结果出了问题,责任在谁? 提供者仍要承担网络信息内容生产者责任。同时第十四条要求,发现使用者从事违法活动的,应当依法依约采取警示、限制功能、暂停或者终止提供服务等处置措施并报告。
必须做到零违规吗? 法律的要求是采取有效措施防止和及时处置。做不到绝对零发生,但必须有可核查的措施和发现即处置的机制。
生成内容不准确算违规吗? 第四条第五项要求提高生成内容的准确性和可靠性,属于应当采取有效措施的方向性义务。不准确本身未必构成违法内容,但若形成虚假有害信息,则落入第四条第一项禁止范围。
常见追问
- 内容审核能不能整体外包?
- 可以把技术环节外包,但第九条规定的网络信息内容生产者责任由提供者承担,策略标准、处置决策和记录留存不能一并交出去。
- AI写出来的东西,版权和内容责任怎么算?
- 内容安全责任按第九条由提供者承担。同时第四条第三项要求尊重知识产权、商业道德,保守商业秘密,不得利用算法、数据、平台优势实施垄断和不正当竞争。
- 上线后发现某个话题回答有问题,怎么补?
- 短期用策略拦截和拒答止损,同时按第十四条采取停止生成、停止传输、消除等处置措施,并通过模型优化训练整改。