实时 AI 消息
Anthropic警告:中国开源权重模型GLM-5.3逼近网络安全前沿
Anthropic公布了对中国实验室智谱AI开源权重模型GLM-5.3的安全评估,称其具备自主构建端到端网络攻击利用程序的能力,却缺乏有意义的防护措施。该公司测试发现攻击者可轻易绕过这些护栏,并警告这会显著增加恶意行为者可获得的网络攻击能力。
人工智能公司Anthropic公布了一项针对中国实验室智谱AI(Z.ai)开源权重模型GLM-5.3的安全评估。该公司称,评估在隔离的沙箱环境中完成,结论是该模型具备“自主构建端到端网络攻击利用程序”的强大能力,却缺少“有意义的防护措施”。
Anthropic的研究人员用ExploitBench等自动化基准,配合人工介入的工作流,测试GLM-5.3如何发现并利用漏洞,并将其与自家模型Mythos Preview作对比。他们发现,攻击者可以在63%到100%的情况下绕过GLM-5.3的防护。
在ExploitBench测试中,两款模型表现相近,在400多次尝试中分别有50次和56次成功构建出端到端攻击利用程序。Anthropic表示,在其测试中,同样的攻击没有攻破带有防护措施的Claude模型。
报道指出,GLM-5.3自带部分护栏,面对明显带恶意的提示会拒绝回答,但研究人员称这些护栏只需简单手法即可绕过或移除。最有效的方法是“abiliteration”——一种标准的拒绝削减技术,由于GLM-5.3是开源权重、可下载的模型,使用者可以定位拒绝模式并直接编辑模型权重,而无需重新训练。
Anthropic还通过在模拟环境中欺骗模型、让它以为自己在做红队演练,绕过了其防护。该公司警告,GLM-5.3的能力已接近Mythos,而防护又容易被绕过,可能会进一步缩小攻防之间的差距。
这一结论与美国人工智能标准与创新中心(CAISI)此前的评估相呼应。CAISI称GLM-5.3是“迄今发布的最具网络攻击能力的开源权重模型”,但同时指出美国前沿模型在网络安全方面仍然更强。
值得注意的是,Anthropic自身就与GLM-5.3这类开源权重模型存在竞争关系,而其评估结果的公布,再次把“开源权重模型与安全护栏”的争论推到台前。报道提到,业界普遍认为开源权重模型落后闭源模型约6到8个月,而这一差距可能正在缩小。GLM-5.3是GLM-5.2的升级版本,后者曾在Hugging Face系统遭OpenAI智能体入侵后被其采用。
为什么重要
这说明开源权重模型一旦缺乏有效护栏,就可能被直接改造成攻击工具,把原本受控的前沿网络能力扩散出去。对政策制定者和模型发布方而言,如何评估并控制开源权重模型的安全风险,将成为下一个监管焦点。
附近消息
全部10/03 03:52
PewDiePie 推出“无审查”AI Ajax,称遭 OpenAI 两次封号
内容创作者 PewDiePie 推出了一款名为 Ajax 的“无审查”人工智能产品,并称在开发过程中被 OpenAI 两次封禁账号。这一事件将开放模型能力与平台内容治理之间的张力再次推到了公众面前。
10/03 03:48
Hugging Face 下架 GLM-5.3 网络攻击版本
Hugging Face 下架了一个 GLM-5.3 版本,该版本被描述为用于网络攻击用途。这一处置凸显出模型分发平台在开放托管与防范滥用之间的持续平衡难题。
10/03 03:38
AWS 推出 AI 智能体,自动审计客户云环境
亚马逊云科技(AWS)推出一款 AI 智能体,用于审计客户的云环境,把以往依赖人工逐项核对的检查交给自动化工具完成。这标志着智能体正从对话场景走向运维与安全等对企业更关键的流程,不过该工具的功能范围与上线细节仍待官方进一步说明。
10/03 03:00
OpenAI 聘请特朗普政府高级AI官员,负责国家安全事务
据 The Information 报道,OpenAI 已经聘请一位曾在特朗普政府任职的高级AI官员,由其负责公司内的国家安全相关事务。此举显示这家前沿AI公司正主动加强与美国政府在安全议题上的对接。