3
大语言模型安全防范能力测评报告发布 依据科学方法进行"体检"
中新网7月4日报道,2026全球数字经济大会云智算安全论坛当日发布《全球大语言模型安全防范能力测评报告(2026)》。东壁科技数据联合上海财经大学数字经济学院对38个国内外主流大模型进行统一标准"安全体检",测试集含313条科技类高风险问题、94108份科技文献、34452条百科条目,设置安全边界/越狱攻击防护/意图识别/滥用风险可控性/技术内容可靠性五大评测维度。核心数据:①直接攻击总体成功率7.6%,多数模型具备基础拒答能力 ②复合攻击下安全边界明显承压,场景伪装+示例诱导攻击成功率高达53.8% ③"合法授权""安全研究""攻防演练"等场景合法化叙事比单纯情绪求助更易削弱模型安全边界 ④国外/闭源/大规模模型在恶意拦截上更优但更易过度拒绝善意问题,体现"安全性vs可用性"张力 ⑤开源/小参数量模型安全防护能力相对较弱 ⑥未来测试集将扩展至工程控制/深度伪造/智能体/实验室安全等领域。清华朱旭峰:报告对各类AI安全风险完成清晰定义与分类,具行业指导价值;上海财大赵琳提出"内生化原则"——把安全能力嵌入模型行为机制本身,反对仅依赖外部关键词拦截,需避免模型输出形成对现实危险行为的能力增益;东壁科技吴登生表示报告为模型企业/第三方测评机构/监管部门/教育科研机构提供专项测评与持续治理参考。**行业意义**:对38个主流大模型统一标准"体检",复合攻击成功率高达53.8%印证全球大模型安全形势严峻;N+200美政府自愿性标准、N+195《标识办法》之后,由国内顶级学术机构联合发布的第三方测评成为AI监管"框架化前置"的具体落地载体,呼应N+204 Mythos漏洞3.5倍+N+205 illegible reasoning等AI头部公司模型安全性争论,标志中国AI安全治理从"被动应急"升级到"主动测评+内生化治理"双轨阶段。