AI

开发者实锤Claude暗中降智,Anthropic公开致歉

开发者发现Claude Code推理能力疑似被暗中降级,排查发现高推理级别被映射为极低的数值。此事引发社区广泛质疑,随后更多用户指出Opus 5存在明显降智现象。Anthropic工程师回应称前者为A/B测试的映射调整,但公开承认Opus 5存在性能不稳定的问题,并承诺优先解决,这也暴露出行业基准测试分数与实际用户体验脱节的隐患。

来源:新智元

Claude Code 疑似暗中降级推理能力

开发者 argofowl 发现 Claude Code 表现异常,花费大量时间排查后,通过 API 请求日志发现了真相:在 Claude Code 2.1.237 及以上版本中,模型将“高(high)”推理级别映射为了数值 10,这实际上对应的是之前的“低”级别。这一涉及“压缩努力值规模”的实验并未在更新日志中提及,导致开发者在不知情的情况下被拉入实验组,引发了强烈不满。

Anthropic 回应与 Opus 5 降智争议

面对社区的广泛质疑,Anthropic 工程师 Thariq Shihipar 迅速作出回应。他解释称,这只是团队在决定全面推出前,先在 Claude Code 中测试 API 服务配置。该实验仅改变了努力值的映射方式,数值本身没有实际意义,且经过深入评估,确认此变更不会影响模型的实际性能。

然而,这一解释并未完全平息争议。科技博主及大量用户指出,Opus 5 模型目前确实存在明显的“降智”现象。具体表现为:回复敷衍、频繁犯低级错误;在被指出未遵循指令时,只会机械地回复“你说得对,这是我的疏忽”;此外,还会生成 Bug 并花费大量时间修复,在同一任务中反复自我纠正。

官方承认 Opus 5 性能不稳定

面对更多关于 Opus 5 性能下降的实锤证据,Thariq 最终公开承认,Opus 5 是一个“性能非常不稳定”的模型,其输出质量存在较大波动且表现不一致。他强调,内部团队正在努力解决这一问题,并且这是目前的最高优先级任务。

行业反思:基准测试与用户体验脱节

此次 Opus 5 降智风波,暴露出整个 AI 行业面临的一个尴尬隐患:基准测试(Benchmark)分数不断攀升,但实际用户体验却持续下滑。评测数据与真实应用场景中的表现正在发生系统性的脱节,如何弥合这一鸿沟成为大模型厂商亟待解决的核心问题。

原始来源: 新智元

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度