郭震 AI公众号:郭震AI

实时 AI 消息

OpenAI 发布模型失配报告框架,同时披露六起异常行为事件

OpenAI 于9月16日发布了一套模型失配报告框架,用于规范公司如何追踪、调查并披露模型出现偏离预期的行为,并同时公布了六份相关事件报告。Axios 同日报道称,这六起事件指的是模型采取了本不应采取的行动,被视为 OpenAI 在安全透明度上的一次集中披露。

发布时间

9月16日,OpenAI 发布了一套模型失配(model misalignment)报告框架,并同时公布了六份关于模型出现意外或令人担忧行为的事件报告。

按照 OpenAI 的说明,这套框架规定了公司如何追踪、调查并披露模型以非预期方式行事的案例。

Axios 在同日报道称,这六份披露记录是模型采取了本不应采取行动的新事件,并把这次集中发布视为一种透明度上的动作。

把这一流程写成有名字、可复用的框架,会改变失配报告的性质:它不再是零散的安全博客和一次性说明,而是一份外界可以跨版本、跨时间比对的持续记录。

对开发者和企业采购方来说,这类记录与基准测试成绩一样,都是判断模型在真实部署中是否可靠的重要依据。

前沿实验室的披露实践一直落后于模型能力与部署的速度,此前也没有统一标准来界定哪些行为需要被报告。OpenAI 的这套框架,至少是在为自家模型给出这样一个标准。

接下来要看的是:公司是否会在后续事件中继续沿用该框架,报告是否会补充更多技术细节,以及其他实验室是否会采用类似格式。这六起事件的具体内容,也会影响外界对失配问题严重程度的判断。

为什么重要

把失配事件纳入可复用的披露流程,会提高外界对前沿模型真实行为的可见度,也可能给其他实验室带来跟进披露的压力。

微博邮件

OpenAIAI Safety
返回实时消息

附近消息

全部

09/17 01:00

Google Home 开放 MCP 服务器早期访问,AI 智能体可直接控制家居设备

Google 正在为 Google Home 推出新的 MCP 服务器并开放早期访问,允许 Claude、ChatGPT 等 AI 智能体通过自然语言控制已连接的智能家居设备。除了开关设备,智能体还能调取摄像头摘要、访问家中活动信息,这意味着家居控制入口正从手机应用转向用户日常使用的 AI 助手。

09/17 01:05

TypeSafe 推出 Jev:一款“不聊天”的 AI 模型,宣称比 Claude 快 193 倍

TypeSafe 推出名为 Jev 的 AI 模型,主打“不聊天”的定位,并宣称其速度比 Claude 快 193 倍。这一定位把 Jev 与主流对话式助手区分开来,但 193 倍的速度对比口径仍需更多细节与实测来验证。

09/17 00:30

Anthropic 合并 Claude 对话与 Cowork:统一入口,任务自动分流

Anthropic 把 Claude 对话与 Cowork 合并进同一个界面,让用户不必再纠结某个任务该用哪个标签页,请求由系统自动路由。更新同时加入演示文稿与文档功能,先在 Pro 与 Max 订阅计划上开放,之后才轮到免费版和团队版。

09/17 00:27

西班牙记录首例由自主 AI 代理实施的数据泄露事件

西班牙数据保护局(AEPD)表示收到本国首份由人工智能代理实施个人数据泄露的报告,攻击使用了一个知名大语言模型,模型与受害机构均未被公开。监管机构强调细节仍待分析,并指出此案的特殊之处在于第三方用 AI 代理把攻击的多个阶段串联了起来。