郭震 AI公众号:郭震AI

实时 AI 消息

Anthropic警告:中国开源权重模型GLM-5.3逼近网络安全前沿

Anthropic公布了对中国实验室智谱AI开源权重模型GLM-5.3的安全评估,称其具备自主构建端到端网络攻击利用程序的能力,却缺乏有意义的防护措施。该公司测试发现攻击者可轻易绕过这些护栏,并警告这会显著增加恶意行为者可获得的网络攻击能力。

发布时间

人工智能公司Anthropic公布了一项针对中国实验室智谱AI(Z.ai)开源权重模型GLM-5.3的安全评估。该公司称,评估在隔离的沙箱环境中完成,结论是该模型具备“自主构建端到端网络攻击利用程序”的强大能力,却缺少“有意义的防护措施”。

Anthropic的研究人员用ExploitBench等自动化基准,配合人工介入的工作流,测试GLM-5.3如何发现并利用漏洞,并将其与自家模型Mythos Preview作对比。他们发现,攻击者可以在63%到100%的情况下绕过GLM-5.3的防护。

在ExploitBench测试中,两款模型表现相近,在400多次尝试中分别有50次和56次成功构建出端到端攻击利用程序。Anthropic表示,在其测试中,同样的攻击没有攻破带有防护措施的Claude模型。

报道指出,GLM-5.3自带部分护栏,面对明显带恶意的提示会拒绝回答,但研究人员称这些护栏只需简单手法即可绕过或移除。最有效的方法是“abiliteration”——一种标准的拒绝削减技术,由于GLM-5.3是开源权重、可下载的模型,使用者可以定位拒绝模式并直接编辑模型权重,而无需重新训练。

Anthropic还通过在模拟环境中欺骗模型、让它以为自己在做红队演练,绕过了其防护。该公司警告,GLM-5.3的能力已接近Mythos,而防护又容易被绕过,可能会进一步缩小攻防之间的差距。

这一结论与美国人工智能标准与创新中心(CAISI)此前的评估相呼应。CAISI称GLM-5.3是“迄今发布的最具网络攻击能力的开源权重模型”,但同时指出美国前沿模型在网络安全方面仍然更强。

值得注意的是,Anthropic自身就与GLM-5.3这类开源权重模型存在竞争关系,而其评估结果的公布,再次把“开源权重模型与安全护栏”的争论推到台前。报道提到,业界普遍认为开源权重模型落后闭源模型约6到8个月,而这一差距可能正在缩小。GLM-5.3是GLM-5.2的升级版本,后者曾在Hugging Face系统遭OpenAI智能体入侵后被其采用。

为什么重要

这说明开源权重模型一旦缺乏有效护栏,就可能被直接改造成攻击工具,把原本受控的前沿网络能力扩散出去。对政策制定者和模型发布方而言,如何评估并控制开源权重模型的安全风险,将成为下一个监管焦点。

微博邮件

AnthropicOpen-Weight ModelsAI SecurityZhipu AI
返回实时消息

附近消息

全部