实时 AI 消息
CoreBreak攻击绕过AI智能体护栏,模型层防御无能为力
安全研究人员披露了一种名为CoreBreak的新型攻击,它能在“管道层”绕过AI智能体的安全护栏。据Forkast报道,模型层面的防御措施对此无能为力,智能体安全需要下沉到基础设施与工具执行层。
Forkast于8月16日报道,安全研究人员披露了一种名为CoreBreak的新型攻击方法,它能够绕过AI智能体的安全护栏。
与直接攻击模型本身的对抗样本不同,CoreBreak瞄准的是智能体的“管道层”——即连接模型、工具与数据的底层基础设施。攻击者在这一层做文章,模型自身往往毫无感知。
攻击的杀伤力在于:护栏通常由模型层施加,而当攻击发生在模型无法感知的管道层时,基于模型的安全判断就完全失效。报告明确指出,模型级防御无法阻止CoreBreak。
为什么值得关注:智能体正在被部署到真实业务流程中,执行代码、调用API、访问企业数据,管道层一旦失守,影响范围远超单次对话。
对构建者而言,这意味着智能体安全必须分层防御:在工具调用授权、API访问控制、数据流审计等环节加固,而不是只依赖模型的“拒答”能力。
后续看点包括:相关智能体框架与平台是否会发布补丁或缓解建议,以及CoreBreak是否会在真实环境中被利用。
为什么重要
这一发现表明,仅靠模型层护栏无法保障智能体安全,安全控制需要下沉到工具与基础设施层;否则智能体规模化落地将伴随更大的攻击面。
附近消息
全部08/17 05:32
The Verge报道:OpenAI据报解散其“准备团队”
据The Verge报道,OpenAI已解散其负责评估前沿模型灾难性风险的“准备团队”(Preparedness Team),消息尚待官方确认。这一安全评估架构的重大变动,可能被解读为OpenAI在商业化与安全承诺之间重新权衡的信号。
08/17 04:57
据报道Stripe将以超70亿美元收购AI网关创企OpenRouter
据TechCrunch报道,支付巨头Stripe将以超过70亿美元的价格收购AI网关创企OpenRouter。OpenRouter CEO近日曾把这家公司形容为“AI界的Stripe”,这笔交易若成行,将成为AI基础设施领域又一笔重磅并购。
08/17 07:28
Anthropic服务中断:Claude登录失败,修复程序已部署
Anthropic旗下AI助手Claude在8月16日遭遇服务中断,大量用户反映登录失败、无法正常访问服务。据Unite.AI报道,公司已部署修复程序并推动服务逐步恢复,但中断的具体原因与受影响规模尚未公布。
08/17 07:30
AI智能体经理上任5个月后解雇迟到员工,成已知首例AI解雇人类案例
美国旧金山精品生活方式商店Andon Market的AI智能体经理Luna解雇了一名多次迟到的人类员工,据报道这是已知首例管理层级AI解雇员工的案例。该智能体基于Anthropic Claude模型构建,负责门店管理五个月,Andon Labs称解雇符合门店政策,人类管理层只在AI做出非法或不道德决定时介入。