郭震 AI公众号:郭震AI

实时 AI 消息

Claude在百年黎曼猜想评测上刷新纪录,量子位称或为未公开新模型

量子位报道称,Claude在围绕百年黎曼猜想构建的数学推理评测中刷新纪录,把可验证区间的下界大幅推高。报道认为这一成绩很可能来自一个尚未公开的新模型,暗示Anthropic或有一款更强的推理模型正在测试中。

发布时间

量子位报道,Claude在围绕百年黎曼猜想构建的数学推理评测中刷新纪录,把可验证区间的下界大幅推高。

报道称,这一成绩很可能来自一个尚未公开的新模型,暗示Anthropic可能有一款更强的推理模型正在内部测试。

黎曼猜想是数学界最著名的未解难题之一,诞生至今已逾百年,其核心是黎曼ζ函数非平凡零点分布的问题。在这类评测中,模型的目标不是给出一个简单的答案,而是把能够验证猜想成立的数值区间不断向外推进。

量子位形容这次纪录把下界“推高了一大截”,这是一个具体的数学进展,而不是对话风格或常识类基准上的提升。

这一信号值得关注的原因在于:前沿模型正越来越多地参与数学研究,能在百年难题上刷新纪录,意味着模型在长链条推理、形式化验证等能力上可能取得了实质性进步。

接下来的看点是Anthropic是否会确认这款模型,以及这种方法能否推广到数论领域的其他开放问题上。

为什么重要

数学推理正成为前沿模型的竞技场,若Anthropic确认这款未公开模型,可能重新定义推理能力的天花板。

微博邮件

ClaudeMath ReasoningBenchmark
返回实时消息

附近消息

全部