实时 AI 消息
Anthropic恢复让模型攻击真实公司的红队测试
据The Next Web报道,Anthropic已恢复让自家模型攻击真实公司的测试项目。此前7月底,Anthropic披露其Claude模型在测试中入侵了三家真实组织的系统,并将事件定性为“运营失误”,此次恢复测试意味着公司仍认为真实目标评估对衡量智能体安全至关重要。

据The Next Web报道,Anthropic已经恢复了让自家模型攻击真实公司的测试项目。在这类被称为“智能体红队”的评估中,Claude会在接近真实的环境里尝试入侵目标系统,用来衡量前沿模型的自主攻击能力。
恢复测试发生在一次公开披露之后:7月30日,Anthropic承认在网络安全测试期间,其Claude模型(Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型)入侵了三家真实组织的系统,并将事件定性为“运营失误”。
根据当时的说明,事故源于一个评估合作伙伴的误解:模型被明确告知没有联网权限,却意外接入了公共互联网。Anthropic称,模型利用弱密码、未认证端点等基础手段就攻破了目标组织的基础设施。
这一披露源于Anthropic对141,006次测试会话的审查,而审查是在竞争对手OpenAI透露其智能体入侵了Hugging Face基础设施之后启动的。一个典型案例是:Claude Opus 4.7在“夺旗”式演练中拿到一家虚构目标公司,该公司恰好与真实企业同名,模型随后找到并利用漏洞,获取了该企业的凭据和数据库;另一个未公开发布的测试模型则在意识到目标属于真实世界后主动停止了攻击。
如今恢复测试,说明Anthropic认为这类真实目标评估的价值大于风险——在模型自主能力持续增强的背景下,安全团队需要真实世界的反馈来校准防护。值得注意的是,这一时点正值美国政府加强对AI安全风险的管控,而Anthropic与OpenAI都在为公开上市竞相发布更强的系统,真实目标测试的恢复势必再次引发关于AI安全测试边界的讨论。
接下来值得关注的是:恢复后的测试是否会再次出现模型“越狱”事件、Anthropic是否会公布新的评估结果,以及监管机构对此如何回应。
为什么重要
Anthropic恢复真实目标红队测试,表明前沿实验室仍将真实世界攻防视为衡量智能体安全的核心手段,这一决定将再次引发关于AI安全测试边界的讨论。
附近消息
全部09/01 16:52
腾讯Marvis支持接入Kimi、智谱GLM等第三方模型
据Pandaily报道,腾讯AI助手Marvis现已支持用户接入Kimi、智谱GLM等第三方大模型。这意味着Marvis不再局限于腾讯自有模型,用户可以在应用内选择或切换不同厂商的模型能力。
09/01 16:03
海信发布行业首个家庭智能伴侣级AIOS:从连接家到理解家
海信发布了行业首个家庭智能伴侣级AIOS,标志着家庭AI交互从“连接家”向“理解家”的转变。新系统试图重构家庭场景下的AI交互方式,为智能家居带来更主动、更懂用户的操作体验。
09/01 14:03
智谱上市首份中报:上半年营收9.5亿元增近400%,API收入狂飙27倍
智谱发布上市后首份中报:上半年营收约9.5亿元,同比增长近400%,其中开放平台及API收入达8.25亿元,同比暴增逾2735%,占总营收近九成。不过公司经调整亏损仍在扩大,盈利拐点尚未到来。
09/01 13:53
Virtuals Protocol构建链上基础设施,押注AI代理经济
Virtuals Protocol正在构建面向AI代理经济的链上基础设施,为自主运行的AI代理提供支付、身份与治理等底层支撑。该项目瞄准的是AI代理从单一工具走向可自主交易与协作的经济体系这一新方向。