断网、限时 4 小时、没有人类指挥,只丢给模型一个研究目标和一把能自己打分的尺子,它能不能独立做出一份科研成果?
五款被测模型里,Claude Opus 5 综合第一;在部分任务上,它甚至超过了人类基线,给出了作者团队自己都没找到过的解法
但比起排名,这份基准更值得聊的是「它怎么考」
#大模型评测 #autoresearch









断网、限时 4 小时、没有人类指挥,只丢给模型一个研究目标和一把能自己打分的尺子,它能不能独立做出一份科研成果?
五款被测模型里,Claude Opus 5 综合第一;在部分任务上,它甚至超过了人类基线,给出了作者团队自己都没找到过的解法
但比起排名,这份基准更值得聊的是「它怎么考」
#大模型评测 #autoresearch








