群发资讯网

Claude Opus 5一出手,AI Agent的座次彻底被打乱了。 Aren

Claude Opus 5一出手,AI Agent的座次彻底被打乱了。
Arena刚放出最新Agent排行榜,Opus 5 Max空降第2,High版紧跟第3,直接插入Fable 5和GPT-5.6之间。这不是跑分,是实打实的7千多次真实代理会话投出来的名次,模型需要自己联网、查文件、开终端,去完成那些长链条的复杂任务,骗不了人。
更狠的是Opus 5 Max在净改进率上拿11.88%,Confirmed Success和Praise vs Complaint两项关键信号全部排第一。等于说用户用脚投票,觉得它干活最稳、最让人省心。以往我们总默认GPT会在Agent这种硬核场景里稳坐前排,这轮却是Claude追上来撕裂缝隙。
这背后其实藏着一个值得看的信号:模型不再拼多模态炫技,而是拼“把事儿办成”的能力。Agent赛道拼的是工具调用容错率、长程规划稳固度,Claude这次的刷榜,恰恰说明在这条真实任务链的路上,能打的牌不止一张。GPT的统治,不是铁板一块了。