【绝大多数人的工作能力已经不如AI了】根据Serafini援引的llm-stats.com排行榜数据(截至2026年6月),AI Agent在OSWorld-Verified基准测试中的表现在过去一年发生了质变:一年前最优模型得分为42%,如今最优模型Claude Fable 5已达85%,超过人类测试者在同一任务集上约72%的完成率。

【绝大多数人的工作能力已经不如AI了】根据Serafini援引的llm-stats.com排行榜数据(截至2026年6月),AI Agent在OSWorld-Verified基准测试中的表现在过去一年发生了质变:一年前最优模型得分为42%,如今最优模型Claude Fable 5已达85%,超过人类测试者在同一任务集上约72%的完成率。
