3

Claude把病毒起源算错90年,都是网页惹的祸?

Anthropic 披露 Claude 等顶级 AI 在生物医学数据库检索中频繁翻车:在 NCBI Virus 基准测试中,无专用检索层时各家智能体准确率从 16.9% 一路散到 91.3%,"及格线实际上是 100%"。最典型的是 Claude Sonnet 4 对同一条埃博拉病毒序列查询三次分别返回 106 条、15 条、5 条(正确答案 266 条);在 2026 年 5 月刚果(金)邦地布焦型埃博拉疫情关键分析中,Sonnet 4 把疫情起源时间从 2014 年错算为 1922 年(凭空多算 90 多年),抗体疗法分析三次跑出三种完全不同的突变图景,"错得理直气壮,是科研里最可怕的一种错误"。问题根源在于生物医学数据库是为人类网页点击而非为 AI 设计,零散数据库、千奇百怪文件格式、一次性检索脚本,让 AI 缺乏稳定可复现机器路径,少一条记录可能让疫情起点偏移几周。Anthropic 联合 NCBI 推出确定性检索层 gget virus,把网页过滤逻辑翻译成可复现程序接口。接入后所有系统准确率飙升至 90% 以上,GPT-5.5 达 99.7%,运行稳定性升至 0.92-1.00,模型之间的差距被大幅抹平。事件揭示 AI 在严肃科学场景下根本性失败与"模型转向地基"的范式转变必要性。