实时 AI 消息
Claude在百年黎曼猜想评测上刷新纪录,量子位称或为未公开新模型
量子位报道称,Claude在围绕百年黎曼猜想构建的数学推理评测中刷新纪录,把可验证区间的下界大幅推高。报道认为这一成绩很可能来自一个尚未公开的新模型,暗示Anthropic或有一款更强的推理模型正在测试中。
量子位报道,Claude在围绕百年黎曼猜想构建的数学推理评测中刷新纪录,把可验证区间的下界大幅推高。
报道称,这一成绩很可能来自一个尚未公开的新模型,暗示Anthropic可能有一款更强的推理模型正在内部测试。
黎曼猜想是数学界最著名的未解难题之一,诞生至今已逾百年,其核心是黎曼ζ函数非平凡零点分布的问题。在这类评测中,模型的目标不是给出一个简单的答案,而是把能够验证猜想成立的数值区间不断向外推进。
量子位形容这次纪录把下界“推高了一大截”,这是一个具体的数学进展,而不是对话风格或常识类基准上的提升。
这一信号值得关注的原因在于:前沿模型正越来越多地参与数学研究,能在百年难题上刷新纪录,意味着模型在长链条推理、形式化验证等能力上可能取得了实质性进步。
接下来的看点是Anthropic是否会确认这款模型,以及这种方法能否推广到数论领域的其他开放问题上。
为什么重要
数学推理正成为前沿模型的竞技场,若Anthropic确认这款未公开模型,可能重新定义推理能力的天花板。
附近消息
全部08/11 11:51
Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字
据 qbitai.com 消息,Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字。大水印时代来了
08/11 11:37
机器人维修"骨科大夫"兴起:月入6000元起,第三方维修比返厂便宜约两成
随着人形机器人和机器狗出货量爆发,机器人维修正在成为一门新职业:从业者月收入约6000至8000元起步,熟练工可过万。第三方维修店客单价约为机器人售价的10%-15%,比返厂维修便宜约两成,周期也从超过一个月缩短到一周左右。
08/11 11:11
全球AI安全实战化测评出炉,中国方案DoGNAVY闯入前三
量子位报道,在面向AI智能体的全球安全实战化测评中,中国方案DoGNAVY闯入前三。随着智能体开始自主行动,如何为它们戴上安全“项圈”正成为行业焦点,这一排名显示中国方案在智能体安全实战能力上已跻身全球第一梯队。
08/11 10:53
Anthropic与比特币矿企Riot Platforms达成91亿美元AI算力协议
Anthropic与比特币挖矿企业Riot Platforms签署为期20年的算力供应协议,总值91亿美元,Riot将从得克萨斯州罗克代尔数据中心园区向Anthropic提供191兆瓦计算能力。协议含两次5年续期选项,潜在总额最高可达161亿美元,消息公布后Riot股价盘后大涨25%。