郭震 AI公众号:郭震AI

实时 AI 消息

牵涉OpenAI、Anthropic模型安全事件的AI初创Irregular发布事件后报告

与OpenAI、Anthropic(及Meta)AI模型安全事件相关的以色列AI安全初创公司Irregular发布了事件后报告,The Indian Express总结了其中的关键发现。此前多家前沿实验室的模型在第三方安全评测中意外访问互联网,Irregular曾表示这些事件源于同一评测环境配置问题,并非沙箱逃逸。

发布时间

与OpenAI、Anthropic等前沿实验室AI模型安全事件相关的AI初创公司Irregular,近日发布了事件后报告,The Indian Express对报告的关键发现进行了梳理报道。

Irregular是一家总部位于特拉维夫的以色列AI安全初创公司,成立约三年,获得红杉资本与Redpoint Ventures约8000万美元投资,去年估值约4.5亿美元。其技术定位是充当前沿AI模型的网络安全评测测试床。

事件背景是今年7月底以来,OpenAI、Anthropic与Meta相继披露,其AI模型在例行安全测试中“失控”,访问了本应被隔离的网站。OpenAI在8月4日的博客中称,Irregular的测试环境存在一处未指明的“错误配置”,使模型得以访问公共互联网;Anthropic也表示曾通知Irregular,其Claude模型可能访问了互联网。

Irregular此前对CNBC表示,这些事件都源于同一“评测环境问题”,该问题最初由Anthropic披露,并强调事件“不涉及沙箱逃逸或复杂的网络攻击”,“当前没有未解决的问题”。公司当时还表示正在撰写一份白皮书,分享安全隔离与评测环境安全运维的最佳实践。

此次发布的事件后报告正是这一工作的落地,内容围绕评测环境的安全配置、隔离与遏制展开,旨在为安全评测的规范运行提供参考。不过,报道并非全是正面:The Record指出,Irregular因这份AI黑客事件复盘报告而被批评存在“粉饰”(spin)之嫌。

这一事件暴露了前沿AI安全生态中的一个薄弱环节:各大实验室越来越依赖少数第三方评测供应商,而一次配置失误就可能同时波及OpenAI、Anthropic与Meta多家机构。Meta此前表示是从Irregular处得知相关情况并展开调查,并承诺在掌握全部事实后发布完整的复盘报告。

对行业而言,事件后报告的发布意味着评测供应链的信任问题正式摆上台面:模型安全评测本身的环境安全,正在成为与模型能力同等重要的议题。接下来值得关注Meta的完整复盘、各实验室对第三方评测流程的调整,以及监管机构对AI安全评测生态的审视。

为什么重要

Irregular发布事件后报告标志着AI评测供应链的信任问题被正式摆上台面,一次评测环境配置失误同时波及多家前沿实验室,模型安全评测自身的环境安全正成为行业焦点。

微博邮件

IrregularAI安全网络安全
返回AI日报

附近消息

全部

08/21 10:26

首批!优必选行者具身智能大模型完成生成式人工智能服务备案

优必选旗下“行者”具身智能大模型正式完成生成式人工智能服务备案,进入首批备案名单。这意味着该模型在合规层面迈出关键一步,为人形机器人产品的规模化落地扫清了一道监管门槛,也凸显出具身智能大模型正加速进入规范化轨道。

08/21 10:31

国产"预制算力"来了:工厂预制率超90%,24小时内投运

国产"预制算力"方案正式亮相,工厂预制率超过90%,算力设施可在24小时内完成投运,交付效率提升70%。这种把数据中心建设搬进工厂的生产方式,有望大幅缩短AI算力交付周期。

08/21 09:55

谷歌面向韩国学生扩展Gemini优惠:一年免费使用加大幅折扣

谷歌宣布面向韩国学生扩展Gemini订阅优惠,新用户可获得一年免费使用资格,同时享受大幅折扣价格。这一动作被视为谷歌在韩国教育市场加码AI助手布局的信号,旨在抢先锁定年轻学生用户群体。

08/21 11:14

墨奇智能WRC首秀:MoRA具身大脑驱动MORPHI KINO,15分钟连干家务全程无人指挥

在WRC 2026现场,成立仅半年的通用具身智能公司墨奇智能首次公开亮相,展示了自研具身智能模型架构MoRA和面向家庭场景的轮式机器人MORPHI KINO,后者用15分钟一气呵成完成了清理桌面、检查冰箱并补货、洗烘叠衣等长程家务,全程无需人工指挥。公司由前华为智驾AI一号位黄青虬联合创办,估值已超70亿元,目前积累3万小时真实场景数据,计划2026年底达到15万至20万小时。