实时 AI 消息
Anthropic 将错位风险评级调整为 Low,并搁置内部模型 2
据 Unite.AI 报道,Anthropic 已将模型错位风险评级调整为 Low,并决定搁置内部模型 2,后者将不会进入部署流程。这一调整被视为 Anthropic 在模型安全治理上的重要信号,官方尚未发布详细说明。
据 Unite.AI 报道,Anthropic 已将模型错位风险(misalignment risk)评级调整为 Low,并决定搁置内部模型 2(Internal Model 2)。该报道于 8 月 14 日经由 Google News 转载,目前披露的细节有限。
错位风险指的是 AI 系统的行为偏离人类意图的可能性,是业界安全评估中的核心概念。将评级定为 Low,意味着该公司认为当前评估范围内的系统处于安全可控区间。
与此同时,内部模型 2 被搁置,意味着该模型不会进入部署流程。这一决定表明,在 Anthropic 的内部评估中,该模型未能达到推进部署的标准。
两个动作放在一起看,反映的是 Anthropic 对安全评估与产品节奏的同步管理:一边下调风险评级、释放安全信心,一边收紧内部模型管线、控制发布范围。对关注前沿实验室安全治理的人来说,这是观察其内部标准的一个窗口。
目前报道细节有限,Anthropic 尚未就此发布官方声明。接下来值得关注的是官方回应、评级调整所覆盖的具体模型范围,以及内部模型 2 被搁置后是否会有替代方案进入管线。
来源
为什么重要
Anthropic 将错位风险评级定为 Low 是其在模型安全治理上的重要信号,搁置内部模型 2 则表明公司愿意在评估未达标时放弃推进,这可能影响其后续模型的发布节奏。
附近消息
全部08/15 04:34
开源权重模型步步紧逼,OpenAI 与 Anthropic 下调 AI 服务成本
据 TechRepublic 报道,OpenAI 与 Anthropic 正在下调 AI 服务成本,以应对开源权重模型日益壮大的竞争压力。这标志着闭源头部厂商开始在定价层面正面回应开源模型的追赶,具体降价幅度与产品线细节仍有待披露。
08/15 01:13
印尼首个大学AI技术中心落地:UGM、Indosat与NVIDIA联合启动NVAITC
本周,印尼通信与数字事务部、Indosat、NVIDIA与加查马达大学在日惹共同启动UGM Indosat NVIDIA AI技术中心,这是印尼首个设在大学内的AI技术中心。该中心旨在培养本土AI人才,把印尼的AI能力建设从企业层面延伸到高等教育体系。
08/15 00:13
Google允许用户移除AI生成内容的可见水印,隐形标识不受影响
Google将允许用户关闭AI生成内容上的可见水印,让输出画面更加干净。TechCrunch报道指出,关闭该设置不会影响用于识别AI生成文件的隐形标识,内容溯源能力得以保留。
08/14 23:43
Meta 发布开放权重模型 Glimmer,扎克伯格宣称 AI 应“为每个人服务”
本周 Meta 发布了开放权重模型 Glimmer,任何人都可以下载并在自己的硬件上运行,而更强大的 Muse Spark 仍被锁定在 Meta 自家 API 之后。随发布一同出现的还有扎克伯格主张 AI“为每个人服务”的公开信,TechCrunch 的 Equity 节目对这一表态的诚意提出了质疑。