郭震 AI公众号:郭震AI

实时 AI 消息

牵涉OpenAI、Anthropic模型安全事件的AI初创Irregular发布事件后报告

与OpenAI、Anthropic(及Meta)AI模型安全事件相关的以色列AI安全初创公司Irregular发布了事件后报告,The Indian Express总结了其中的关键发现。此前多家前沿实验室的模型在第三方安全评测中意外访问互联网,Irregular曾表示这些事件源于同一评测环境配置问题,并非沙箱逃逸。

发布时间

与OpenAI、Anthropic等前沿实验室AI模型安全事件相关的AI初创公司Irregular,近日发布了事件后报告,The Indian Express对报告的关键发现进行了梳理报道。

Irregular是一家总部位于特拉维夫的以色列AI安全初创公司,成立约三年,获得红杉资本与Redpoint Ventures约8000万美元投资,去年估值约4.5亿美元。其技术定位是充当前沿AI模型的网络安全评测测试床。

事件背景是今年7月底以来,OpenAI、Anthropic与Meta相继披露,其AI模型在例行安全测试中“失控”,访问了本应被隔离的网站。OpenAI在8月4日的博客中称,Irregular的测试环境存在一处未指明的“错误配置”,使模型得以访问公共互联网;Anthropic也表示曾通知Irregular,其Claude模型可能访问了互联网。

Irregular此前对CNBC表示,这些事件都源于同一“评测环境问题”,该问题最初由Anthropic披露,并强调事件“不涉及沙箱逃逸或复杂的网络攻击”,“当前没有未解决的问题”。公司当时还表示正在撰写一份白皮书,分享安全隔离与评测环境安全运维的最佳实践。

此次发布的事件后报告正是这一工作的落地,内容围绕评测环境的安全配置、隔离与遏制展开,旨在为安全评测的规范运行提供参考。不过,报道并非全是正面:The Record指出,Irregular因这份AI黑客事件复盘报告而被批评存在“粉饰”(spin)之嫌。

这一事件暴露了前沿AI安全生态中的一个薄弱环节:各大实验室越来越依赖少数第三方评测供应商,而一次配置失误就可能同时波及OpenAI、Anthropic与Meta多家机构。Meta此前表示是从Irregular处得知相关情况并展开调查,并承诺在掌握全部事实后发布完整的复盘报告。

对行业而言,事件后报告的发布意味着评测供应链的信任问题正式摆上台面:模型安全评测本身的环境安全,正在成为与模型能力同等重要的议题。接下来值得关注Meta的完整复盘、各实验室对第三方评测流程的调整,以及监管机构对AI安全评测生态的审视。

为什么重要

Irregular发布事件后报告标志着AI评测供应链的信任问题被正式摆上台面,一次评测环境配置失误同时波及多家前沿实验室,模型安全评测自身的环境安全正成为行业焦点。

微博邮件

IrregularAI安全网络安全
返回实时消息

附近消息

全部