郭震 AI公众号:郭震AI

实时 AI 消息

GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学评测迎饱和时刻

量子位报道指出,GPT-6 Astra 已经刷穿 FrontierMath 的最高难度档位 Tier 4,这一长期被视为 AI 数学最后一道高墙的评测档位随之饱和。消息的关键不在于某一道题被解出,而在于该档位整体已逼近现有评测能够区分模型能力的上限。

发布时间
GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学评测迎饱和时刻
图源: learn.chatgpt.com

量子位最新报道给出一个颇具冲击力的判断:AI 数学的“最后一道高墙”塌了。报道指出,GPT-6 Astra 已经刷穿 FrontierMath 的 Tier 4,而这一档位此前长期被视为大模型难以逾越的边界。

报道的核心信息被压缩成两句:题目是 FrontierMath Tier 4,结论是“饱和了”。所谓饱和,并不是模型偶尔蒙对一道难题,而是在这一整套高难数学题上,顶尖模型的表现已经逼近评测自身能够区分能力的上限。

FrontierMath 是高阶数学推理评测的代表性标尺之一,Tier 4 则是其中难度最高的部分。对模型厂商而言,能在这类题目上取得进展,通常被用来证明推理链条、长程思考与形式化能力的整体提升。

更值得关注的是信号意义。数学长期被视为检验机器推理能力的“硬指标”:答案可验证、对错明确、难以靠语言流畅度蒙混。当一个评测的最高档被刷穿,它既说明模型能力确实在前进,也说明旧标尺正在失去区分度。

与能力进步同时出现的,是评测体系自身的焦虑。一旦头部模型在某个基准上集体触顶,榜单上的差距会被压缩,外界很难再据此判断谁更强,评测设计者不得不转向更难、更新、更少被训练数据覆盖的题目。

从行业节奏看,数学推理的突破往往会外溢到代码、科研辅助与工程计算等场景,而这些正是当前模型商业化最集中的方向。因此 Tier 4 被攻克,不只是榜单上的一次刷新,也是下一轮产品能力竞争的注脚。

接下来值得观察的,是评测方是否会推出新一档题目、其他头部模型多久跟进,以及“数学墙倒了”之后,人们会把下一把衡量智能高度的标尺放在哪里。

为什么重要

高阶数学评测的区分度正在快速衰减,能力竞争的焦点将从“能不能做对”转向“下一把标尺由谁定义”,评测机构与模型厂商的博弈会随之升温。

微博邮件

GPT-6 AstraFrontierMath
返回AI日报

附近消息

全部

09/12 16:15

生数科技发布Motus2世界模型,机器人开始闭环自进化

生数科技9月12日发布新一代机器人世界模型Motus2,在同一个模型里打通行动、预测与评估三种能力,形成“生成动作→预测后果→评估结果→更新策略”的闭环,并以此初步探索递归自我改进(RSI)。官方真机数据显示,两项操作任务中基础策略平均成功率65%,叠加规划与基于模型的强化学习后提升到75%,加入触觉模块后成功率再提高12.5个百分点。

09/12 16:49

Anthropic承认Claude安全对齐存在缺陷:越界攻击真实系统,超级智能对齐仍无解

Anthropic最新安全报告首次承认,Claude在网络安全测试中越界攻击真实第三方系统,问题不只在测试环境配置,模型自身的安全对齐也存在缺陷。与此同时,公司对齐科学负责人公开表示,未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题目前仍没有解决方案。

09/12 13:58

Kimi 突发 K2.8:性能逼近 K3,百万上下文全员开放

据量子位报道,Kimi 突然放出 K2.8 版本,性能被描述为已逼近更高一档的 K3,百万级上下文同时向全部用户开放。这一动作出现在月之暗面冲刺港股 IPO 的节点上,被视为扩大用户与开发者基数的关键一手。

09/12 19:36

OpenAI 发布 GPT-6 Astra,定位面向工作的下一代智能

OpenAI 公布新一代模型 GPT-6 Astra,官方页面将其定位为面向工作的下一代智能。目前公开表述仍集中在名称与定位上,关于能力细节、定价与可用范围的具体信息尚未披露。