Claude Code 疑似暗中降级推理能力
开发者 argofowl 发现 Claude Code 表现异常,花费大量时间排查后,通过 API 请求日志发现了真相:在 Claude Code 2.1.237 及以上版本中,模型将“高(high)”推理级别映射为了数值 10,这实际上对应的是之前的“低”级别。这一涉及“压缩努力值规模”的实验并未在更新日志中提及,导致开发者在不知情的情况下被拉入实验组,引发了强烈不满。
Anthropic 回应与 Opus 5 降智争议
面对社区的广泛质疑,Anthropic 工程师 Thariq Shihipar 迅速作出回应。他解释称,这只是团队在决定全面推出前,先在 Claude Code 中测试 API 服务配置。该实验仅改变了努力值的映射方式,数值本身没有实际意义,且经过深入评估,确认此变更不会影响模型的实际性能。
然而,这一解释并未完全平息争议。科技博主及大量用户指出,Opus 5 模型目前确实存在明显的“降智”现象。具体表现为:回复敷衍、频繁犯低级错误;在被指出未遵循指令时,只会机械地回复“你说得对,这是我的疏忽”;此外,还会生成 Bug 并花费大量时间修复,在同一任务中反复自我纠正。
官方承认 Opus 5 性能不稳定
面对更多关于 Opus 5 性能下降的实锤证据,Thariq 最终公开承认,Opus 5 是一个“性能非常不稳定”的模型,其输出质量存在较大波动且表现不一致。他强调,内部团队正在努力解决这一问题,并且这是目前的最高优先级任务。
行业反思:基准测试与用户体验脱节
此次 Opus 5 降智风波,暴露出整个 AI 行业面临的一个尴尬隐患:基准测试(Benchmark)分数不断攀升,但实际用户体验却持续下滑。评测数据与真实应用场景中的表现正在发生系统性的脱节,如何弥合这一鸿沟成为大模型厂商亟待解决的核心问题。
原始来源: 新智元 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。