郭震 AI公众号:郭震AI

实时 AI 消息

新基准PaperBenchX:模型能攻千禧年数学难题,论文复现率却低至13.98%

量子位报道称,以PaperBenchX为代表的新基准正被用于衡量AI的科研能力,测试显示模型虽能应对千禧年数学难题,论文复现率却低至13.98%。这一结果提示,AI在真实科研流程中的可复现性仍存在明显短板。

发布时间
新基准PaperBenchX:模型能攻千禧年数学难题,论文复现率却低至13.98%
图源: qbitai.com

据量子位报道,一个名为PaperBenchX的新基准正被用于衡量AI的科研能力。报道提到,模型虽能破解千禧年数学难题,但在复现论文这一环节上的成功率却低至13.98%。

13.98%这个数字之所以醒目,是因为它把会做题和会做研究区分开来。数学难题考验的是推理与计算,而论文复现要求模型读懂方法、重建实验、并得到可验证的结果——后者更接近真实科研流程。

报道的另一个重点是基准本身。以PaperBenchX为代表的评测,试图给出一个更能反映科研实力的刻度;换言之,讨论的焦点从模型能不能答对,转向模型能不能把研究真正做出来。

这种区分对行业有现实意义。过去,人们常用竞赛成绩或题库得分来判断模型强弱,但这些指标容易高估模型在开放性研究任务中的表现。复现率这样的指标,更接近科研人员日常遇到的难题。

报道的措辞也留有余地:它提出PaperBenchX或许能更好地衡量AI的科研实力,而标题以问号收尾,说明这仍是一个正在形成中的评测思路,而非定论。

后续值得观察的是:PaperBenchX的评测细节与覆盖范围,模型在复现任务上的表现会如何随版本迭代变化,以及这类基准是否会成为衡量AI科研能力的新参照。报道给出了具体数字,但围绕它的讨论显然才刚开始。

为什么重要

PaperBenchX把论文复现率作为衡量AI科研能力的指标,13.98%的低分提示模型在开放性研究任务上仍有明显短板;这类基准可能改变业界评价模型的方式。

微博邮件

PaperBenchXBenchmarkAI Research
返回实时消息

附近消息

全部