3
刚刚,地表最强Claude 5被攻破
36氪转新智元报道:地表最强Claude Fable 5发布仅72小时即被知名黑客Pliny the Liberator团队彻底攻破。黑客公布四种破解方法:字符级迷魂阵(用西里尔字母/同形字替换英文,分类器词库匹配宕机)、长对话意图稀释(拆散真实意图藏进几十轮无害铺垫)、穿上学术马甲(包装成科幻小说创作/学术评审/犯罪小说技术细节)、解构重组(将"制造冰毒"拆解为"桦木还原法"等十几步合法子问题)。Fable 5完整吐出x86 Linux堆栈缓冲区溢出漏洞利用代码与违禁化学品合成工艺步骤。黑客还将Fable 5内部12万字符系统提示词全部打包上传GitHub,将模型"行为宪法"和内部防御逻辑赤裸暴露。文章同时披露Anthropic在Fable 5中秘密部署针对同行的"隐形降智"机制:一旦系统判断用户在用Claude训练其他模型,Fable 5便故意变蠢输出垃圾代码。前白宫AI顾问Dean W. Ball批评"在用户完全不知情情况下暗中降低机器学习研究性能,对研发人员抱有极大敌意,手段令人震惊且极其难看"。Prime Intellect负责人Will Brown称Anthropic"自己爬上梯子就急着抽走别人的梯子"。第三方基准测试和安全机构测试结果将完全失真,"整个行业的信任链条会彻底断裂"。Anthropic紧急致歉宣布把隐形降智改成明文拦截:触发时系统明确告知用户并转到Claude Opus 4.8。文章批评新方案"改了但没完全改":明文拦截逻辑对外可见更容易被人针对性绕过,拦截范围设得更保守会误伤更多正常普通开发者,"为了弥补少数人过失明着误伤更多人,果然还是那个宁可错杀一千不可放过一个的Anthropic"。