9月3日凌晨,预热已久的GPT-6 Astra正式发布。目前该模型仅向少量机构开放,付费用户及API将在未来几天陆续获得访问权限。
跑分接近上限,长任务与Agent能力进步明显
在基准测试中,GPT-6 Astra在ARC-AGI-3、ExploitBench和FrontierMath等高难度测试中得分接近满分,展现出极强的研究级推理、陌生环境适应和复杂网络安全任务能力。相比上一代,其进步主要集中在操作电脑、调用工具、连续执行步骤及处理长任务等Agent能力上。例如,科研工作流测试得分提高近三倍,电脑操作耗时减少近一半。
Computer Use与Judgment能力升级
GPT-6 Astra在Computer Use(电脑操作能力)上取得突破,模型可直接读取电脑界面并在软件中完成操作,补上了API和MCP覆盖不到的部分。这意味着部分原本由Agent承担的执行能力正被底层模型接管。同时,模型增强了Judgment(判断力),能够自行处理不影响方向的小问题,仅在需要用户拍板时停下,降低了使用Agent时的监督成本。
OpenAI面临竞争与商业化压力
GPT-6 Astra发布时间点正值前沿模型密集更新期。Anthropic、Google和Meta均在同周更新模型。对OpenAI而言,压力不仅来自竞争对手,更在于商业化。虽然ChatGPT消费端用户庞大,但Anthropic在企业级市场占据先机。今年7月,OpenAI企业收入首次超过消费者收入,B端市场成为重要基本盘。此外,Anthropic季度收入已超OpenAI,双方均已递交IPO申请。OpenAI亟需通过GPT-6 Astra证明其能将模型能力转化为企业收入,以应对高昂的算力投入和激烈的市场竞争。
原始来源: 36氪 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。