郭震 AI公众号:郭震AI

实时 AI 消息

OpenAI 组建数学与 AI 咨询小组,审核新兴成果的发布口径

OpenAI 于 9 月 21 日宣布,正在与一个独立的“数学与人工智能咨询小组”合作,由该小组指导新兴 AI 成果的评审与对外沟通。这项安排把外部数学界引入模型成果的发布流程,回应的是模型给出的数学结论如何被核验、又该以什么口径向外界呈现的问题。

发布时间

OpenAI 于 9 月 21 日在其官方新闻频道发布消息称,公司正在与一个独立的“数学与人工智能咨询小组”(Advisory Group on Mathematics and Artificial Intelligence)合作,由该小组为其审阅和对外沟通新兴的 AI 研究成果提供指导。

按照公告的表述,这个小组承担两项职能:一是审阅新兴的 AI 成果,二是对这些成果如何向外界沟通给出建议。公告把小组定义为“独立”性质,但并未披露成员构成、任期或具体的工作流程。

把外部数学界引入成果发布流程,是这次安排最值得注意的地方。数学长期被当作检验模型推理能力的试纸:一个结果对与错界限分明,可以由不在场的人独立复核,也很难靠措辞上的圆滑掩盖。

OpenAI 把“评审”和“沟通”分开表述,说明它关注的不仅是结果真假,还有呈现方式——在什么范围内发布、用多强的措辞、是否会被过度解读。对以数学成绩作为能力证据的前沿实验室来说,这三件事往往同时决定一次发布的效果与风险。

这类问题在近年的模型成果中反复出现:一项由模型协助得出的结论,究竟应当算作模型的能力,还是人类研究者借助工具取得的成果?引入外部咨询小组,是在发布环节预先给出答案的一种办法。

从行业做法看,这也延续了前沿实验室把外部专家拉进能力与安全评估的趋势:交出一部分判断权,换取公布结果时的可信度。对 OpenAI 来说,代价是发布节奏多了一道外部环节,收益是数学这类硬成果更容易被同行接受。

接下来需要观察三点:小组成员名单何时公开,审查意见是否可被引用或公开,以及这套流程是只覆盖数学,还是会扩展到其他可被验证的领域。

在此之前,这次公告更像一个机制的开始,而不是结论。它给出了流程的方向,但还没有给出流程本身。

为什么重要

把外部数学界纳入成果评审,等于为最容易被独立验证的一类 AI 输出增加了一道外部关卡。同行实验室在公布类似成果时,也将面临说明各自评审安排的压力。

微博邮件

OpenAIPolicyResearch Review
返回实时消息

附近消息

全部

09/21 20:00

MIT科技评论公布美墨边境“虚拟墙”调查:有人穿过AI监控区未被发现,随后在附近身亡

MIT科技评论9月21日发布调查报道,聚焦美国政府沿美墨边境部署的“虚拟墙”,即由监控塔构成的、搭载先进AI能力的监视网络。调查记录了有人穿过这些AI监控塔覆盖的区域而未被发现、随后在附近身亡、遗体未能被及时发现的情况,并在报道中提出四种应对失效的方式。

09/21 20:51

报告预计2030年全球活跃智能体数量将达22.16亿个

9月21日,新浪财经刊发报道称,一份报告预计到2030年全球活跃智能体数量将达到22.16亿个。这个量级把智能体从单个工具推向规模化基础设施的问题:身份、权限、计费与治理都需要按亿级规模重新设计。

09/21 20:59

Meta Muse AI Agent 登陆 Mac,主打复杂任务处理

据 India TV News 报道,Meta 的 Muse AI Agent 已经登陆 Mac 平台,并支持处理复杂任务。这意味着 Meta 的智能体能力进入桌面端工作流,也让本就拥挤的桌面 AI 助手赛道再添一名大厂玩家。

09/21 18:00

AI动态:5 Companies Using NVIDIA AI for Clean Energy

据 blogs.nvidia.com 消息,5 Companies Using NVIDIA AI for Clean Energy。Clean energy isn’t hard to come by, but the pace of large scale adoption has historically been slow due to bottlenecks — including out of date infrastructure, elongated research and development timelines, and upfront cost barriers. At New York Climate Week, NV...