生成式AI暂行办法

AI生成违法违规内容,平台要怎么防?

依据:《生成式人工智能服务管理暂行办法》
结论:该办法第四条禁止生成危害国家安全、煽动分裂、宣扬恐怖主义极端主义、宣扬民族仇恨歧视、暴力淫秽色情以及虚假有害信息等法律、行政法规禁止的内容,并要求防止歧视。第九条明确,提供者依法承担网络信息内容生产者责任,履行网络信息安全义务,防护需贯穿算法设计、训练数据选择、模型优化和提供服务全流程。

你可能要做的

  1. 建立生成内容的分类审核与拦截规则
  2. 对高风险提问设置拒答与转人工策略
  3. 在模型优化环节持续补充安全样本
  4. 保留生成与拦截日志以备检查
  5. 定期回扫生成内容做抽样评估

条文依据

《生成式人工智能服务管理暂行办法》 第四条
提供和使用生成式人工智能服务,应当遵守法律、行政法规,尊重社会公德和伦理道德,遵守以下规定:
《生成式人工智能服务管理暂行办法》 第四条
(一)坚持社会主义核心价值观,不得生成煽动颠覆国家政权、推翻社会主义制度,危害国家安全和利益、损害国家形象……
《生成式人工智能服务管理暂行办法》 第九条
提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务。

一句话结论

AI 生成内容出了问题,责任不会因为「是模型自己生成的」而消失。《生成式人工智能服务管理暂行办法》第九条把提供者定性为网络信息内容生产者,第九条第一句给了定性,第四条给了具体不能生成什么。

依据

第四条要求提供和使用生成式人工智能服务时遵守法律、行政法规,尊重社会公德和伦理道德,并列出五项要求。第一项是核心负面清单:不得生成煽动颠覆国家政权、推翻社会主义制度,危害国家安全和利益、损害国家形象,煽动分裂国家、破坏国家统一和社会稳定,宣扬恐怖主义、极端主义,宣扬民族仇恨、民族歧视,暴力、淫秽色情,以及虚假有害信息等法律、行政法规禁止的内容。

第二项要求防止歧视,且范围覆盖全流程:算法设计、训练数据选择、模型生成和优化、提供服务等过程中,都要采取有效措施防止产生民族、信仰、国别、地域、性别、年龄、职业、健康等歧视。

第五项要求基于服务类型特点采取有效措施,提升服务的透明度,提高生成内容的准确性和可靠性。

第九条给出责任定性:提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务。这意味着安全义务不是选做项,而是提供者的身份自带义务。

你要做什么

  1. 建立内容安全策略。分层处理:明显违规的直接拒绝生成,灰区内容降级或转人工,正常内容放行。
  2. 把第四条第一项的负面清单转成可执行的拦截规则集,而不是停留在制度文件里。
  3. 对高风险场景(政务、医疗、金融、新闻资讯)单独收紧策略,因为这些领域对准确性和可靠性的要求更高。
  4. 在模型优化环节持续补充安全样本,把线上发现的问题回流到训练和策略中。
  5. 留存生成内容与拦截记录,用于事后复盘和应对检查。
  6. 定期抽样回扫,检查策略是否出现漏网或误杀。

容易踩的坑

常见追问

用户故意诱导,生成结果出了问题,责任在谁? 提供者仍要承担网络信息内容生产者责任。同时第十四条要求,发现使用者从事违法活动的,应当依法依约采取警示、限制功能、暂停或者终止提供服务等处置措施并报告。

必须做到零违规吗? 法律的要求是采取有效措施防止和及时处置。做不到绝对零发生,但必须有可核查的措施和发现即处置的机制。

生成内容不准确算违规吗? 第四条第五项要求提高生成内容的准确性和可靠性,属于应当采取有效措施的方向性义务。不准确本身未必构成违法内容,但若形成虚假有害信息,则落入第四条第一项禁止范围。

常见追问

内容审核能不能整体外包?
可以把技术环节外包,但第九条规定的网络信息内容生产者责任由提供者承担,策略标准、处置决策和记录留存不能一并交出去。
AI写出来的东西,版权和内容责任怎么算?
内容安全责任按第九条由提供者承担。同时第四条第三项要求尊重知识产权、商业道德,保守商业秘密,不得利用算法、数据、平台优势实施垄断和不正当竞争。
上线后发现某个话题回答有问题,怎么补?
短期用策略拦截和拒答止损,同时按第十四条采取停止生成、停止传输、消除等处置措施,并通过模型优化训练整改。

我们是谁:面向小微企业的知识库与 AI 客服服务团队,做「AI 客服过国标、过备案」的落地交付。

本站内容依据公开发布的法规原文整理,用于企业自查参考;具体申报口径以属地网信部门要求为准,不构成法律意见。

本页由 中国 AI 合规与备案 MCP 语料库生成 —— Agent 可直接调用同一份数据。