群发资讯网

2026年9月,人工分析(Artificial Analysis)赶在v5大版本

2026年9月,人工分析(Artificial Analysis)赶在v5大版本前先发了智能指数v4.2。为啥这么急?因为GPT-6 Astra刚出时,在老指数里和前代GPT-5.6 Sol差不多分,被不少人骂打分不准;再加上前面几周前沿模型一个接一个发,老题目已经分不出高下了,机构只能提前把v5里的部分新东西搬出来。
这回改规则是重点。GPQA钻石题被踢出去了——顶尖模型都快考满分,没法拉开差距。私藏不外露的测试题权重从v4.1的20%直接翻倍到40%,就是防实验室盯着公开题刷分。新加的AA-Briefcase用内部留存的真实办公场景(几千份文件、干好几周的活);Surge AI做的GDP.pdf更狠:100份PDF、4592页、1275条专家标准对答案。AA-LCR v1.1也顺手修了答案库错处。
分数跟着变:Claude Fable 5.1(max带退回)57分第一,GPT-6 Astra(max)55分第二,Opus 5是54,Fable 5和Meta的Muse Spark 1.3同拿53,GPT-5.6 Sol和Grok 4.6各51,Kimi K3是50。
我看这榜,重点不在两分差,而在"怎么考"。Astra长处在长文档和代币省——同分数下输出token比多数前沿模型少;但Fable 5.1能力尖,单任务成本也最贵。Anthropic和OpenAI整体领跑,Meta第三,成本效率上Anthropic、OpenAI、Meta、Z AI四家占帕累托前沿。榜是死了,活干的活才是真的,以后选模型得看自家任务像不像AA-Briefcase那种苦差事。ai行情分析 AI实测对比 AI模型横评 AI量化分析 AI成绩分析 ai公司估值 AI模型梯度榜