郭震 AI公众号:郭震AI

实时 AI 消息

OpenAI公布Astra初步网络安全评估:强化AI智能体安全防护

OpenAI 8月7日发布文章,首次公开其智能体 Astra 的初步网络安全评估,并介绍为强化安全防护与安全控制所采取的步骤。此次披露聚焦AI在关键网络能力领域的新前沿,将大模型在攻防两端的能力风险摆上台面。

发布时间

OpenAI 8月7日在官网发布文章《应对关键网络能力的新前沿》,首次公开其智能体 Astra 的初步网络安全评估,并介绍了为强化安全防护与安全控制所采取的步骤。

文章称,这些评估是"初步"的,意味着对 Astra 在网络安全领域潜在能力的摸底仍处于早期阶段,相关结果将随模型迭代持续更新。

OpenAI 同时披露了正在推进的安全措施,包括加强安全防护和安全控制,以应对前沿模型能力提升带来的新风险。

这一披露的背景是,AI 智能体正承担越来越多的自主任务,网络攻击者与防御者都在尝试借助大模型的能力。

OpenAI 公开评估结果的做法,为大模型安全评测提供了一个参照,也把大模型在网络攻防中的双刃剑风险摆上台面。

对行业而言,头部实验室主动公开安全评估,有助于推动模型安全评测走向透明化,也为监管讨论提供了素材。

后续值得关注的是,OpenAI 是否会披露更详细的评估方法与数据,以及这些安全控制将如何随 Astra 能力的迭代持续演进。

为什么重要

OpenAI 主动公开智能体网络安全评估,有望推动大模型安全评测走向透明化,并为行业监管提供参照。

微博邮件

OpenAISecurityAstra
返回实时消息

附近消息

全部

08/08 00:16

Cloudflare发布Kitesurf:专为AI智能体打造的云端浏览器

Cloudflare 推出 Kitesurf,一款专为 AI 智能体打造的云端托管浏览器。官方称其执行常见自动化任务时比 Chromium 更省算力,可帮助开发者更高效地构建基于浏览器的 AI 智能体。

08/07 22:22

Airbnb测试AI搜索功能:AI正帮助其更快交付新功能

据TechCrunch报道,Airbnb正在测试新的AI搜索功能,并称AI正在帮助团队更快地交付新功能。这家短租平台将推出一个带开关控制的AI驱动搜索体验,目前该功能仍处于测试阶段。

08/07 22:00

AI动态:Jill Lepore on the ‘Artificial State’ and why Silicon Valley’s leaders are bad sci fi readers

据 techcrunch.com 消息,Jill Lepore on the ‘Artificial State’ and why Silicon Valley’s leaders are bad sci fi readers。Historian Jill Lepore has a theory about why tech companies often use soaring language to describe their products — almost as if they’re forming a new government. And whether you’re thinking of Twitter’s old “town hall in your pocket” or Anthropic’s Claude con...

08/08 02:40

OpenAI叫停新模型Astra内部活动:或具备"关键级"网络安全能力

OpenAI宣布暂停其开发中的模型Astra的相关内部活动,原因是该模型尚不满足公司新设立的安全标准,内部评估显示其在智能体编程和网络安全方面能力显著,无法排除达到"关键级"网络攻击能力的可能。公司称Astra并未参与此前的Hugging Face事件,并将对高能力模型实施更严格的安全管控和全面监控。