郭震 AI公众号:郭震AI

实时 AI 消息

Goodfire 推出“由内而外”监控器,以更低成本拦截失控 AI 智能体

Goodfire 发布了一种据称更便宜的 AI 智能体监控方案:它不再雇第二个 AI 去通读智能体的每一步操作,而是直接观察模型运行时内部的活动,只有出现异常时才呼叫“后备”介入。该公司称,这种方式能以远低于以往的成本及时发现行为异常的智能体。

发布时间
Goodfire 推出“由内而外”监控器,以更低成本拦截失控 AI 智能体
图源: techcrunch.com

AI 安全公司 Goodfire 于 10 月 8 日发布了一款新的智能体监控工具,声称能以远低于现有方案的成本,及时发现行为异常、可能“失控”的 AI 智能体。

传统思路往往要再引入一个 AI,去逐条阅读主智能体执行的每一步操作,成本高、延迟大,而且随着智能体调用工具、访问数据的次数增加而水涨船高。Goodfire 的方案则反其道而行,采用所谓“由内而外”的方式:监控器直接观察模型在运行时内部的活动,而不是事后核查它的每一条输出。

按照该公司的说法,只有当内部信号显示“情况不对劲”时,系统才会调用更重的审查或“后备”流程介入。这样一来,日常运行时的开销被大幅压低,同时仍保留了发现风险动作的能力。

这背后是一个越来越现实的问题。随着企业把自主智能体放进真实业务流程,它们可以调用工具、访问数据、甚至执行交易,一旦行为偏离预期,责任如何界定、过程如何复盘,目前都还没有成熟答案。

Goodfire 把卖点放在成本上,也说明监控本身正在成为一笔可观的开支。如果每次行动都要再用一个大模型来审阅,规模化部署的账单会迅速膨胀;面向模型内部状态的轻量监控,则试图把这笔钱省下来。

不过,这目前仍是一家公司对自家产品的宣称。它能否在真实、复杂的生产环境中稳定发现异常,而不被“漏报”或“误报”拖垮,还需要第三方评测和实际部署来检验。

可以关注接下来这类监控产品会以何种方式接入主流智能体框架,以及“能看内部状态”是否会成为 AI 安全工具的新标配。

为什么重要

随着自主智能体进入企业流程,监控的成本与有效性正成为落地的关键瓶颈。若 Goodfire 的主张得到验证,AI 安全监控可能从“事后逐条审计”转向“实时、低成本的内部观测”。

微博邮件

GoodfireAI SafetyAgent
返回实时消息

附近消息

全部