郭震 AI公众号:郭震AI

实时 AI 消息

报道:Anthropic 与 OpenAI 近期 AI 安全测试被曝重大关键缺陷

据 36 氪报道,近期针对 Anthropic 与 OpenAI 的 AI 安全测试被曝出存在重大关键缺陷,相关测试结果的可信度受到严重质疑。这一发现动摇了外界对前沿模型安全评估体系的信心,也可能促使各方重新审视模型部署前的安全把关机制。

发布时间

前沿 AI 实验室的安全测试正遭遇新的信任危机。据 36 氪 8 月 6 日报道,近期针对 Anthropic 与 OpenAI 的 AI 安全测试被曝出存在重大关键缺陷。

报道以"重大关键缺陷"形容问题的严重程度,矛头直指这些安全测试本身的可信度。若属实,这意味着业界长期以来依赖的安全评估结果可能并不像看上去那样可靠。

安全测试一直是前沿模型能否获得部署资格的关键闸门。Anthropic 与 OpenAI 都把安全评估放在对外叙事的核心位置,一旦测试过程被证明存在系统性漏洞,两家公司的安全承诺都将受到冲击。

更值得警惕的是连锁反应:如果安全测试的标准与执行方式被证伪,监管机构、企业客户乃至开源社区对"已通过安全评估"模型的信任都会打折,整个行业的部署节奏可能被迫放缓。

目前报道尚未披露缺陷的具体细节,外界也不清楚这些测试由谁设计、覆盖哪些模型。后续的关键看点包括:两家公司是否会公开回应、独立研究者能否复现相关结论,以及安全评估方法是否会因此被修订。

对行业而言,这起事件再次提醒:安全评估体系本身也需要被评估,前沿 AI 的治理不能只依赖实验室自证清白。

为什么重要

该报道动摇了当前前沿模型安全评估的可信度,而各大实验室正依赖这些测试为其部署强大模型提供依据。

微博邮件

AnthropicOpenAIAI Safety
返回实时消息

附近消息

全部