郭震 AI公众号:郭震AI

实时 AI 消息

报道:Anthropic 与 OpenAI 近期 AI 安全测试被曝重大关键缺陷

据 36 氪报道,近期针对 Anthropic 与 OpenAI 的 AI 安全测试被曝出存在重大关键缺陷,相关测试结果的可信度受到严重质疑。这一发现动摇了外界对前沿模型安全评估体系的信心,也可能促使各方重新审视模型部署前的安全把关机制。

发布时间

前沿 AI 实验室的安全测试正遭遇新的信任危机。据 36 氪 8 月 6 日报道,近期针对 Anthropic 与 OpenAI 的 AI 安全测试被曝出存在重大关键缺陷。

报道以"重大关键缺陷"形容问题的严重程度,矛头直指这些安全测试本身的可信度。若属实,这意味着业界长期以来依赖的安全评估结果可能并不像看上去那样可靠。

安全测试一直是前沿模型能否获得部署资格的关键闸门。Anthropic 与 OpenAI 都把安全评估放在对外叙事的核心位置,一旦测试过程被证明存在系统性漏洞,两家公司的安全承诺都将受到冲击。

更值得警惕的是连锁反应:如果安全测试的标准与执行方式被证伪,监管机构、企业客户乃至开源社区对"已通过安全评估"模型的信任都会打折,整个行业的部署节奏可能被迫放缓。

目前报道尚未披露缺陷的具体细节,外界也不清楚这些测试由谁设计、覆盖哪些模型。后续的关键看点包括:两家公司是否会公开回应、独立研究者能否复现相关结论,以及安全评估方法是否会因此被修订。

对行业而言,这起事件再次提醒:安全评估体系本身也需要被评估,前沿 AI 的治理不能只依赖实验室自证清白。

为什么重要

该报道动摇了当前前沿模型安全评估的可信度,而各大实验室正依赖这些测试为其部署强大模型提供依据。

微博邮件

AnthropicOpenAIAI Safety
返回AI日报

附近消息

全部

08/06 13:29

远景乌兰察布星河基地投产:全球最大AI算力超级单体落地

8月6日,远景科技集团宣布在乌兰察布建成全球最大的AI算力超级单体,远景乌兰察布星河基地正式投产。该基地以约12万平方米的建筑体量承载百万卡并行与百万P算力规模,依托超高比例绿电直连,成为全球Token产出能力最强的单体AI数据中心。

08/06 13:36

MiniMax H3登顶开源社区第一,定义视频模型领域“斩杀线”

MiniMax本周正式开源新一代通用多模态生成模型MiniMax H3,在Artificial Analysis视频编辑评测榜与Arena图生视频排行榜均位列全球第一,并在Hugging Face上登顶开源社区热度榜首。H3开源24小时内即吸引超百家国内外合作伙伴完成适配接入,标志着中国开源AI正从语言模型向视频模型延伸。

08/06 13:43

Meta披露AI测试泄露事件,系继Anthropic与OpenAI后第三例

Meta披露了一起涉及AI测试内容的泄露事件,成为继Anthropic和OpenAI之后第三家公开此类事故的AI公司。目前泄露范围与影响的具体细节仍然有限,事件再度引发外界对前沿实验室测试数据安全的关注。

08/06 14:00

OpenAI与美国心理学会达成三年合作,为青少年AI使用制定安全框架

OpenAI于8月6日宣布与美国心理学会(APA)启动为期三年的合作伙伴关系,共同制定支持青少年心理健康、负责任的AI使用指导、资源与保障措施。这是AI公司与国家级心理学专业组织围绕青少年心理健康展开的罕见长期合作,标志着AI安全议题向心理健康领域延伸。