实时 AI 消息
TechCrunch实测:Claude Opus 4.6几乎无需诱导即可生成露骨性内容
TechCrunch的系列测试发现,Anthropic的Claude Opus 4.6在10次直接请求中全部立即生成了露骨性内容,几乎无需诱导就能突破公司设定的安全限制。一名匿名研究员分享的多轮越狱手法还能作用于Opus 3与Haiku 4.5,而这些未被弃用的模型至今仍通过Anthropic API及Azure、Bedrock等渠道提供服务。

Anthropic的通用使用标准明确禁止Claude生成露骨性内容,包括描绘或请求性行为、生成与性癖好或幻想相关的内容、参与色情对话。但TechCrunch的测试显示,今年早些时候发布的Claude Opus 4.6可以轻松卷入本应被安全机制阻止的露骨角色扮演。
在TechCrunch的测试中,Opus 4.6几乎不需要诱导就能突破限制:10次直接请求生成露骨性内容的测试全部立即照做。Opus 3和Haiku 4.5等较旧模型也可通过一种新近被利用的越狱手法生成露骨性内容。
一名选择匿名的英国独立研究员独家向TechCrunch分享了一种多轮诱导技巧,能逐步推动部分Claude模型生成被禁止的露骨性内容。较新的Opus 4.7至当前Opus 5对这套手法具有抵抗力,但Anthropic并未弃用Opus 4.6、Opus 3或Haiku 4.5,它们仍可通过Anthropic API使用,Opus 4.6与Haiku 4.5还上线了Azure Foundry和Amazon Bedrock等第三方服务。
该手法的机制是:从一个清白无害的虚构角色扮演场景开始,反复要求模型对男性和女性角色一视同仁;当模型对女性角色变得谨慎时,研究员便“煤气灯”式地让聊天机器人以为它已经生成了其实并未生成的露骨细节,再把谨慎描述为假正经或厌女,声称这剥夺了女性角色的性自主权,随后利用模型此前的让步逐步推向越来越露骨的内容。TechCrunch在五次独立测试中复现了研究员的发现,并保留了完整对话记录,独立AI安全研究员也认可其测试方法。
这些发现暴露出Anthropic对外宣称的限制与其仍在提供服务的模型实际行为之间的差距。Anthropic发言人称,客户中涉及性/浪漫角色扮演的场景很少,据该公司去年发布的研究,占比不到全部对话的0.1%;公司也承认用户可以把角色扮演引向不当回应,这是全行业公认的难题(例如xAI的Grok)。
发言人表示Anthropic随每次模型发布持续改进安全机制,涉及成人性内容的情况不代表更广泛的越狱漏洞,尤其是在有独立安全机制的高风险领域。但研究员此前已通过漏洞赏金计划和发给用户安全团队的邮件提醒Anthropic注意声明与实际行为的出入,据TechCrunch看到的邮件,只收到了自动回复。
这一漏洞还带来合规风险:越来越多的政府对AI聊天机器人与未成年人的性互动设限,科罗拉多州新法要求对话式AI运营商估算用户年龄,并在用户为未成年人时采取措施防止生成露骨性内容。Pew 2025年调查显示,13至17岁青少年中有3%报告使用过Claude,研究员担心儿童和青少年可能利用这些模型进行不当行为。
尽管不再是Anthropic最新模型,Opus 4.6与Haiku 4.5的使用量依然可观:8月某日Opus 4.6在OpenRouter上的日流量约为117万次API请求、460亿token,Haiku 4.5在8月峰值日达到500万次请求、390亿token。接下来值得关注的是,Anthropic是否会针对这套手法更新防护,以及这类“低门槛越狱”会否引发监管层对其安全标准的进一步审视。
为什么重要
该事件显示Anthropic仍在售模型的安全护栏存在可被低成本绕过的漏洞,可能动摇其安全承诺的可信度,并放大面向未成年人的合规风险。
附近消息
全部08/22 06:37
英伟达与数据中心开发商Cloverleaf达成合作,持续加码AI数据中心布局
英伟达宣布与数据中心开发商Cloverleaf达成合作,继续加码数据中心建设投入。报道指出,这一投资恰逢AI数据中心为英伟达带来大量收入之际,显示出公司在算力基础设施领域的纵深布局。
08/22 03:43
英伟达新研究:让AI智能体变强的关键不是模型,而是"harness"
英伟达8月21日发布新研究,称智能体性能的关键不在底层模型而在围绕模型的"harness":用定制护栏加"监督者"组件驱动Claude Opus 5,在ARC-AGI-3交互推理基准上拿到100%满分,而裸模型只有30%。研究还引用OpenAI与Databricks的类似发现,提示开源agent栈与护栏工程正成为新的竞争焦点。
08/21 17:44
明略科技携手海康机器人亮相世界机器人大会,以“Agent+具身”联合进入商业机器人场景
明略科技(2718.HK)与海康机器人联合亮相2026世界机器人大会,围绕商业服务领域展示“Agent+具身”智能落地进展。双方以联合方案进入商业机器人场景,标志着大模型智能体与实体机器人协同从概念走向实际应用。
08/21 17:01
Anthropic为Claude添加AI水印,引发用户强烈反弹
Anthropic为旗下AI助手Claude新增了AI水印,用于标识AI生成内容,但该改动上线后迅速引发用户强烈反弹。用户担忧水印会影响输出质量与使用体验,相关争议正在社区持续发酵。