郭震 AI公众号:郭震AI

实时 AI 消息

Anthropic 将错位风险评级调整为 Low,并搁置内部模型 2

据 Unite.AI 报道,Anthropic 已将模型错位风险评级调整为 Low,并决定搁置内部模型 2,后者将不会进入部署流程。这一调整被视为 Anthropic 在模型安全治理上的重要信号,官方尚未发布详细说明。

发布时间

据 Unite.AI 报道,Anthropic 已将模型错位风险(misalignment risk)评级调整为 Low,并决定搁置内部模型 2(Internal Model 2)。该报道于 8 月 14 日经由 Google News 转载,目前披露的细节有限。

错位风险指的是 AI 系统的行为偏离人类意图的可能性,是业界安全评估中的核心概念。将评级定为 Low,意味着该公司认为当前评估范围内的系统处于安全可控区间。

与此同时,内部模型 2 被搁置,意味着该模型不会进入部署流程。这一决定表明,在 Anthropic 的内部评估中,该模型未能达到推进部署的标准。

两个动作放在一起看,反映的是 Anthropic 对安全评估与产品节奏的同步管理:一边下调风险评级、释放安全信心,一边收紧内部模型管线、控制发布范围。对关注前沿实验室安全治理的人来说,这是观察其内部标准的一个窗口。

目前报道细节有限,Anthropic 尚未就此发布官方声明。接下来值得关注的是官方回应、评级调整所覆盖的具体模型范围,以及内部模型 2 被搁置后是否会有替代方案进入管线。

为什么重要

Anthropic 将错位风险评级定为 Low 是其在模型安全治理上的重要信号,搁置内部模型 2 则表明公司愿意在评估未达标时放弃推进,这可能影响其后续模型的发布节奏。

微博邮件

AnthropicAI SafetyModel Governance
返回实时消息

附近消息

全部