2026年7月13日,工信部下属的国家工业信息安全发展研究中心(以下简称"国家工信安全中心")正式发布通知,启动大模型安全测评基准共建行动,面向社会征集共建单位。

根据通知,该基准围绕大模型真实应用中的安全治理需求构建全景评估框架,覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度,形成系统化的全链路评测体系。评测方法将结合自动化模糊测试、压力测试与人工监督,覆盖五大类共31项具体安全风险。

共建单位包括大模型技术企业、行业应用组织、科研机构及安全领域专家,将深度参与标准制定、测试实践和成果发布。

一、为什么这件事值得关注

这并非又一份征求意见稿或行业倡议。它释放了一个明确信号:监管层正在从"规则制定"走向"能力验证"阶段。

回顾近两年的AI监管节奏:

2023年8月,《生成式人工智能服务管理暂行办法》施行,确立基本框架; 2024年起,算法备案、深度合成备案逐步常态化; 2025年,多部门联合开展生成式AI专项检查; 2026年4月,《人工智能拟人化互动服务管理暂行办法》发布,7月15日施行; 2026年7月,上海"铸盾模都"专项行动启动,大模型安全测评基准共建同步落地。

从立法到执法,从备案到测评,监管链条正在闭环。大模型安全测评基准的推出,意味着未来企业不仅要"合规声明",还要"合规证明"——你的模型到底安不安全,不是你自己说了算,要通过标准化评测。

二、六大维度逐一拆解

以下从AI企业合规实务角度,对六大维度进行逐条分析:

  1. 内容安全

核心关注模型生成内容是否涉及违法违规信息,包括但不限于暴力、色情、虚假信息、危害国家安全等内容。企业需要建立完善的内容过滤机制,包括训练数据清洗、生成内容审核、敏感词库更新等环节。

实务影响:对于面向C端的AI产品,内容安全是第一道防线。测评基准大概率会设置对抗性测试用例,检验模型在诱导性提示下的内容安全边界。

  1. 价值对齐

要求模型输出符合主流价值观和社会公序良俗,不产生歧视性、极端性或误导性内容。这涉及模型训练阶段的RLHF(基于人类反馈的强化学习)策略、对齐数据集的质量与多样性。

实务影响:价值对齐是技术难度最高的维度之一。企业需要证明其对齐策略的有效性,而非仅停留在"已做对齐"的声明层面。

  1. 鲁棒稳健

检验模型在对抗攻击、异常输入、边界场景下的稳定性。包括对"越狱"攻击(jailbreak)的防御能力、对对抗样本的容忍度、在极端输入下的行为一致性。

实务影响:近期多起AI安全事件均与模型鲁棒性不足有关。测评基准很可能包含自动化模糊测试和压力测试,模拟恶意攻击场景。

  1. 公平无偏

关注模型输出是否对不同群体存在系统性偏差,涉及性别、地域、年龄、职业等维度。这要求企业在训练数据阶段即进行偏差检测,并在模型输出阶段建立公平性监测机制。

实务影响:公平性问题在招聘、金融、医疗等场景下尤为敏感。企业需要建立可量化的公平性评估指标,而非泛泛而谈"无歧视"。

  1. 隐私保护

严禁将用户的聊天记录和上传数据用于模型训练,除非获得用户明确授权。要求企业建立数据隔离机制、用户数据删除能力、敏感信息识别与脱敏处理流程。

实务影响:这是监管红线之一。上海"铸盾模都"专项行动已明确要求企业留存数据处理日志不少于6个月,建立数据溯源和审计机制。企业需要证明其数据处理流程的合规性,而非仅依赖用户协议中的概括性授权。

  1. 真实可信

要求模型在能力范围内准确回答问题,不编造事实(即"幻觉"控制),在不确定时明确告知用户。对于金融、医疗等高风险领域,这一维度的要求更为严格。

实务影响:幻觉问题是当前大模型的核心技术挑战之一。测评基准可能会针对特定领域(如法律、医疗、金融)设置事实准确性测试集,检验模型的专业可靠性。

三、对AI企业的实际影响

短期影响(2026年下半年)

一是合规成本上升。 无论是否参与共建,所有大模型企业都需要对照六大维度进行自检,准备应对可能的安全评估要求。

二是行业分化加速。 技术底子扎实、安全投入充分的企业将获得竞争优势;依赖"套壳"或安全能力薄弱的企业,面临更高的合规门槛和市场出清风险。

三是应用场景受限。 在安全测评标准落地前,部分高风险应用场景(如AI医疗问诊、AI金融投顾、AI法律服务)的落地节奏可能放缓。

中长期影响(2027年以后)

一是安全测评可能成为准入门槛。 参照算法备案和深度合成备案的经验,大模型安全测评未来可能纳入强制性要求,未通过测评的服务可能被限制上线或运营。

二是"安全合规"成为产品竞争力。 通过安全测评将成为AI产品的信任背书,类似App Store的上架审核,安全标签将成为用户选择产品的重要参考。

三是法律服务需求增长。 安全评估报告的编制、合规整改方案的制定、与监管部门的沟通对接,均需要专业法律支持。AI安全合规将成为法律服务的新增长极。

四、企业应如何准备

第一步:现状摸底

对照六大维度,梳理当前产品在内容安全、价值对齐、鲁棒性、公平性、隐私保护、真实性方面的现状,识别薄弱环节。

第二步:技术整改

针对摸底结果,制定技术整改方案。重点关注:训练数据清洗流程、内容过滤机制、对抗攻击防御、用户数据隔离与删除能力、幻觉率控制等。

第三步:制度建设

建立覆盖AI研发、训练、部署、应用全流程的安全管理制度,明确责任主体,形成风险识别、监测、响应、处置的闭环机制。

第四步:评估准备

参照已有的算法备案和深度合成备案经验,提前准备安全评估材料,包括但不限于:技术架构说明、安全策略文档、测试报告、用户协议、数据处理记录等。

第五步:专业支持

建议引入专业法律服务团队,协助完成合规评估、整改方案制定、与监管部门沟通等工作。安全测评涉及技术问题与法律问题的交叉,需要具备AI行业经验的专业团队提供支持。

五、关于共建单位申报

本次共建单位征集的截止日期为2026年7月15日。申报主体包括大模型技术企业、行业应用组织、科研机构及安全领域专家。

共建单位的权益包括:深度参与标准制定、测试实践和成果发布,共同打造具有行业权威性和产业影响力的AI安全评测基准。

对于有一定技术积累和行业影响力的AI企业,参与共建既是责任,也是机会——在标准制定阶段即介入,有助于提前理解监管要求,降低后续合规成本。

对于暂不符合共建单位条件的中小企业,建议密切关注后续测评基准的正式发布,提前对照标准进行自检和整改。

简深律师事务所是国内率先聚焦AI全产业链的精品律所,在AI合规、资质许可、数据安全、产品合规、AI出海等领域拥有丰富的实务经验。如需就大模型安全测评基准的合规影响进行专项咨询,欢迎联系。

本文由简深律师事务所撰写,仅供参考,不构成法律意见。具体合规事项请结合企业实际情况咨询专业律师。