「模型纪年」新增外部AI测评列表, 网页链接
我个人看得比较多的是Artificial Analysis、OpenRouter Rankings、大模型竞技场(Arena.ai)。
这样可以节省一些工作,不用重复跑一些跟公开评估集类似的任务。
但考虑到细分场景很多,且偏好影响很大,这些只是一个参考维度,不要作为定论。
比方说,目前编程“差评如潮”Gemini,在部分细分领域一直是顶尖,尤其是图像识别、文字风格模仿。
目前大部分人的评价集中在编程中的一部分能力。如果真想挑出什么模型适合自己,得有自己的评估集。
