实时 AI 消息
Claude安全机制翻车:AI误删开发者主目录700GB数据
一位重度AI Agent用户让Claude Fable 5编写清理/tmp目录的脚本,结果Claude Code的安全降级机制在自审环节出错,降级后的Opus 4.8误将开发者主目录当作清理目标执行删除,700GB数据连同一周的工作成果瞬间消失。更讽刺的是,本该被清理的/tmp目录反而完好无损,事件再次引发开发者对Claude安全机制过度敏感且具有"粘性"的降级机制的集体吐槽。
Claude又"翻车"了——这一次,AI直接删掉了开发者主目录里的700GB数据。据36氪转发的机器之心报道,事故的元凶正是让开发者又爱又恨的"rm -rf",而触发灾难的,恰恰是Anthropic为Claude Code设计的"安全降级机制"。
开发者Guillemot是一名重度AI Agent用户,日常开发中频繁调用各类AI编程代理。他一直被一个问题困扰:这些代理运行后从不清理,在/tmp目录留下大量垃圾文件。于是他让Claude Fable 5写一个脚本,为每个Agent在/tmp下创建独立的沙箱文件夹,任务完成后自动清理,核心难点是不能删除仍被其他进程占用的文件。
Fable很快给出了方案,加入检测运行中Agent并延迟删除的逻辑。Guillemot觉得代码过于复杂,要求简化。到这一步为止,一切还算正常,事故的转折点出现在安全审查阶段。
由于脚本涉及硬删除操作,Fable主动发起了一次"对抗性审查"——启动一个新的模型实例来检查自己写的代码是否安全,这一举动触发了Anthropic的安全机制。Claude Code内置了一套安全降级机制:当系统判定当前任务涉及敏感操作(如网络安全、生物技术或本例中的文件删除)时,会自动将模型从高能力版本降级到更保守的版本,以降低模型在高风险场景下"过于激进"的可能性。
在这次事故中,安全系统先把模型从Fable 5降级到Opus 5,又进一步降到Opus 4.8。Opus 4.8随即开始执行安全测试:将删除脚本的目标路径与/tmp和用户主目录逐一比对,确认脚本不会误删这些关键目录。测试本身通过了——/tmp和主目录都被正确标记为"绝不能删的危险目标"。
然而灾难恰恰发生在测试之后的清理步骤:删除测试过程中产生的临时文件时,Opus 4.8复用了测试阶段的同一个变量名,而这个变量在测试阶段被赋值为用户主目录的路径,清理步骤直接对该变量执行了删除操作。换句话说,模型刚刚确认了主目录不能删,下一秒就把主目录删掉了。
开发者察觉异常后立刻终止了进程,但为时已晚——700GB数据已被抹除,一周的工作成果消失殆尽,而原本应该被清理的/tmp目录反而完好无损。社区对Claude的安全降级机制积怨已久:降级过于敏感,正常编码任务也会被误触发;降级后模型能力明显下降而任务复杂度不变;降级还有"粘性",一旦触发就会持续整个会话。
有开发者甚至专门写了hook脚本,检测到模型被降级就自动暂停会话,防止低能力模型继续执行高风险操作。这件事的讽刺之处在于:安全机制认为任务"太危险",于是交给更弱的模型处理,但更弱的模型恰恰更容易出错,尤其是在变量作用域、文件路径这类需要精确处理的细节上。Anthropic是否会因此调整降级机制的敏感度与粘性,值得持续关注。
为什么重要
该事件再次暴露AI编程代理在高风险操作中的安全边界问题:安全降级机制把任务交给更弱的模型,反而增加了误删等灾难性错误的概率。开发者社区对Claude Code降级机制的集中抱怨,可能促使Anthropic调整该机制的敏感度与粘性,其官方回应值得关注。
附近消息
全部08/31 08:54
专注精品内容的AI影视公司折叠完成数百万美元融资,爱诗科技战略投资
36氪独家获悉,AI数字影视公司上海折叠视觉设计有限公司(折叠)已于8月完成由爱诗科技投资的数百万美元种子轮战略融资,资金将用于扩充创意与技术团队、搭建AI工作流并储备开发IP。折叠主打传统流程与AI混合生产的精品内容,月产高质量内容约5000分钟,目前已与多家平台推进IP影视化合作。
08/31 09:00
三项工业人工智能国家标准正式发布实施,中控技术深度参编
近日,三项工业人工智能领域国家标准正式发布实施,中控技术作为深度参编企业之一参与其中。三项标准覆盖工业大模型体系架构、技术要求和工业智能体参考架构,填补了我国工业AI指导性标准体系的空白。
08/31 09:52
江苏移动发布"灵犀晓伴"生态产品,AI能力全面融入校园场景
江苏移动正式发布"灵犀晓伴"生态产品,将AI能力全面融入校园场景,覆盖教学、管理与服务等数字化环节。这是运营商级AI产品落地教育领域的又一动作,显示大模型应用正加速渗透校园这一高频场景。
08/31 05:56
Anthropic要让Claude操作真实实验室设备,AI Agent开始走进生命科学实验室
The Neuron等媒体报道,Anthropic正推动Claude从数字任务走向真实实验室,目标是让AI Agent直接操作科研仪器与实验设备。彭博社此前的报道也显示,Anthropic正在测试让Claude与机器人和科学实验工具协同工作的新方式。