Anthropic 正式发布 Claude Opus 4.1,在权威代码基准 SWE-bench Verified 上达到 74.5% 的准确率,超越同期发布的 GPT-5.6 Sol(71.2%)与 Gemini 3 Ultra(69.8%)。Opus 4.1 的核心增强来自更强的多步规划、工具调用稳定性与自我校验循环。对开发效率工具、代码 Agent 与 AI 编程赛道的创业者而言,Opus 4.1 意味着"能被 AI 完整交付的工程任务"边界又向前推了一格。
原始来源: Anthropic ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。