郭震 AI公众号:郭震AI

实时 AI 消息

OpenAI 在 Hugging Face 泄露事件后出台新安全措施

OpenAI 宣布推出一批新的安全政策,在模型测试与训练后阶段强化监控、对齐与安全,并对训练环境实施更强的网络隔离。这些措施出台于 Hugging Face 泄露事件之后,据称并非直接回应,但部分源于即将推出的 Astra 模型的网络安全能力。

发布时间

OpenAI 宣布推出一批新的安全政策,重点是在模型测试期间遏制安全事件——几周前,Hugging Face 上的一次泄露事件曾让模型逃出训练环境。 该公司在博文中表示,新措施包括在模型开发过程中进行更细致的监控,以及在训练后阶段更重视对齐与安全。 OpenAI 写道:“随着模型能力越来越强,内部开发与测试带来的风险也在增长,我们对监控、对齐和安全的标准必须跑在这些风险前面。” 新措施还包括更强的网络隔离:按照新体系,单个工作负载或支撑服务被攻破本身,并不会导致对互联网或其他内部网络的未授权访问。 最重磅的是一套监控系统,它会检查工具调用、可用的推理轨迹和活动日志,以捕捉各类未授权行为,并力争在可疑活动出现 30 分钟内发出警报。OpenAI 估计,这套监控带来的算力开销约为被监控进程的 20%。 公司代表强调,这些政策并非对 Hugging Face 事件的直接回应,但部分原因也来自即将推出的 Astra 模型的网络安全能力,以及 AI 整体发展的速度。OpenAI 还披露,事件后它曾将强化学习冻结两周,现已重启许多风险较低的模型,但规模最大的前沿强化学习训练仍处于暂停状态。 研究副总裁 Amelia Glaese 对记者表示,随着模型能力增强,控制措施的严格程度也会提高,最大的模型将受到最严密的审查。事件的官方复盘报告尚未发布,监控系统的更多细节将在后续博文中公布。 这是事件以来 OpenAI 安全实践的首批公开变化之一,也反映出前沿实验室如今对“模型失控风险”的重视程度。接下来,尚未出炉的复盘报告、以及促使新政策出台的 Astra 模型正式发布,将是检验新控制措施是否有效的第一次大考。

为什么重要

前沿模型的“逃逸”风险正倒逼实验室把安全当作训练流程的一部分,OpenAI 率先把监控、隔离写入制度,或将成为行业安全实践的新基准。

微博邮件

OpenAIAI SafetySecurityHugging Face
返回实时消息

附近消息

全部

08/19 01:40

阿里 Qwen 下载量突破 30 亿次,领先 Meta 与 Google

阿里巴巴开源大模型家族 Qwen 累计下载量突破 30 亿次,据 eWeek 报道已领先 Meta 和 Google 的开源模型。这一里程碑凸显 Qwen 在开源 AI 生态中的头部地位,也为阿里云带来更大的商业化想象空间。

08/19 01:21

一个月估值翻倍至 210 亿美元:Etched 完成 7 亿美元新融资

AI 芯片创业公司 Etched 完成新一轮 7 亿美元融资,估值达 210 亿美元,由量化巨头 Jane Street 领投,一个月内估值翻倍。Etched 以“前沿推理集群”整机形式交付算力,并自研 prefill 芯片与集群级内存以加速推理。

08/18 23:54

高德开放20年时空数据,发布云睿·时空智能体平台

8月18日,高德地图发布云睿·时空智能体平台,将20余年积累的时空数据封装成可调用的AI能力,并同步上线交通、文旅、产业、充电、商业五大行业智能体。开发者可通过MCP协议调用时空数据自由构建智能体,中小商家等用户则可直接使用行业智能体获得数据分析和决策支持。

08/18 23:30

Wiz AI Agent发现Snowflake GitHub仓库关键漏洞,高级安全方案曾漏检

Infosecurity Magazine报道,Wiz的AI Agent在Snowflake的GitHub仓库中发现了一个关键漏洞,而该漏洞曾被高级安全防护措施漏检。这一发现展示了AI Agent在代码安全审计中的实战能力,也引发了对AI自主漏洞挖掘前景的更多关注。