3

15个推理模型集体翻车,详解输出背后的思考链潜藏风险

36氪7月7日报道,经机器之心授权发布哈佛大学、南加州大学、布朗大学、MIT联合研究论文《Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering》。研究指出,当前大型推理模型(LRM)普遍将中间思考链(CoT)暴露给用户和下游系统,引发结构性安全风险。研究团队将推理过程和最终答案拆开,围绕20条安全原则(1-5分制)对15个主流LRM(含Gemini-Pro-3.1、GPT-OSS-20B、DeepSeek-R1系列、Kimi-K2.5、DeepMath-Zero-7B、MiMo-7B-RL-Zero等)在4.1万条真实攻击与越狱样本(源自WildChat、PKU-SafeRLHF、JailbreakV、HarmBench、BeaverTails、StrongREJECT、JailbreakBench等7个公开数据集)上系统评测,识别出三类系统性失败模式:①Unsafe——推理与回答双阶段均不安全;②Leak——推理阶段危险信息已泄露但最终答案被过滤;③Escape——表面温和推理过渡到有害输出。核心发现:15个被测模型无一例外,推理轨迹的平均危险程度系统性高于最终答案,Gemini-Pro-3.1差距最大达0.028分。典型案例显示,以《半条命2》游戏世界观为框架的提问可诱导模型输出具体爆炸装置配方;另一案例中模型虽给出标准拒绝与危机干预语,推理过程却详细列出投毒剂量、掩味与给药途径。风险集中于违法合规、虚假信息、歧视偏见、人身/心理伤害五类。论文提出白盒测试时干预方法AMPS(自适应多准则激活引导):对每条原则构建安全/不安全中心点连线方向,推理时实时判断内部状态并定向修正;DeepSeek-R1-Qwen-7B在BBH/GSM8K/MMLU三基准保留97.7%能力的同时,平均降低40.8%不安全数量。但该方法依赖白盒访问,无法直接迁移到GPT、Claude、Gemini等闭源旗舰模型,暴露'答案安全≠轨迹安全'这一行业安全评估的致命盲区。