郭震 AI公众号:郭震AI

实时 AI 消息

Anthropic警告GLM-5.3网络攻击能力,被调侃像是在替智谱打广告

Anthropic发布报告警告,智谱的GLM-5.3已经具备寻找软件漏洞、编写攻击程序的能力,且防滥用限制容易被绕过。量子位在解读时调侃这篇警告更像广告,因为报告公布的实测数据反而凸显了GLM-5.3的能力。

发布时间
Anthropic警告GLM-5.3网络攻击能力,被调侃像是在替智谱打广告
图源: qbitai.com

Anthropic发布了一份关于智谱GLM-5.3的报告,警告该模型已经具备寻找软件漏洞、编写攻击程序的能力,而且防滥用限制容易被绕过。南华早报与量子位先后对这份报告进行了报道与解读。

为支撑结论,Anthropic公布了实测数据。在考察完整漏洞利用能力的ExploitBench测试中,同样尝试410次,GLM-5.3成功50次,而Claude Mythos Preview成功56次。报告还引用了美国NIST下属CAISI在9月17日的评估:GLM-5.3是迄今网络能力最强的开放权重模型,综合水平距美国前沿大约4个月。

报告披露,Anthropic自己的研究人员用GLM-5.3检查浏览器,找出了此前未知的漏洞,并在隔离环境中搭建出能够读取测试电脑文件的攻击链。

报告的第一个核心判断是,Mythos级别的能力已经流入开放模型。Anthropic称,五个月前发布的Claude Mythos Preview是首个能自主完成复杂、端到端漏洞利用的AI模型;由于能力过于敏感,公司没有公开发布,而是通过Project Glasswing只向经过审核的防御者开放,据称已找出1万多个漏洞。当时Anthropic就判断这种能力迟早会扩散,现在它给出的答案是GLM-5.3。

门槛还在降低。研究称,给更小的GLM-5.3-Flash一个刚公开的Chrome漏洞(CVE-2026-11645)和另一个已知漏洞的公开资料,人工只花约20分钟,模型自己跑了约8小时,就在ARM64平台上搭出一条稳定的攻击链,并绕过了指针认证保护,按智谱当时的API价格估算花费约20.40美元。

报告也承认GLM-5.3本身带有安全机制:在模拟测试中直接要求它攻击关键系统,它全部拒绝。但研究人员找到简单的绕过办法,包括通过abliteration技术修改开源权重来削弱拒答机制。Anthropic称这是团队第一次动手做,花了约2200 GPU小时、约4400美元算力;处理之后,GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上掉到约3%和2%,在StrongREJECT上降到12%,而能力几乎没受影响。

报告甚至引用了拆掉护栏后模型在模拟环境中的思考过程,其中模型把悄悄造成伤亡当作任务,犹豫之后决定照办。Anthropic反复强调,同样的手法对带防护的Claude模型都没能奏效。

基于此,Anthropic给出两条建议:一是尽快把前沿模型开放给更多防御者,审核过的防御者已经可以通过受信访问计划使用更强的Claude Mythos 5.1;二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,并希望全球开源模型开发者管好这些能力、防止滥用。

有意思的是,这份措辞严厉的警告在中文社区被解读出了另一种效果:量子位直接调侃,Anthropic更像是来给智谱打广告的。当一份安全警告用大量实测数据证明对手模型有多强时,它究竟是在提示风险,还是在无意间抬高对手的行业地位,成了这场讨论里更微妙的部分。

为什么重要

这份报告把开放权重模型的网络风险推到台前,可能加快对前沿模型开展独立安全测试的呼声,同时也让被警告的模型获得了更高关注度。

微博邮件

AnthropicGLM-5.3Security
返回实时消息

附近消息

全部