实时 AI 消息
Anthropic 回应 Opus 5.5“干到一半就停”:是程序替它打了下班卡
针对使用者反馈 Opus 5.5 在任务执行到一半时突然停下、像主动放弃的问题,Anthropic 给出了解释:真正“下班”的并不是模型本身,而是它运行所在的程序环境。这一说法把讨论焦点从模型能力转向智能体框架与调用链的可靠性,对正在搭建 Agent 流程的开发者尤其值得注意。

围绕 Anthropic 旗舰模型 Opus 5.5 的一轮讨论正在中文科技媒体上发酵:不少使用者反馈,模型在长任务里常常“干到一半就停”,看上去像是主动放弃。手机新浪网在 9 月 26 日的报道中,把 Anthropic 对这种现象的解释概括成一句话——真正“下班”的不是模型,而是它运行所在的程序替它打了下班卡。
按这一解释,问题的关键不在模型权重或推理能力,而在智能体运行所处的软件环境。当上层脚本、工具调用或工作流判定会话已经结束,模型就被迫中断,而用户看到的却是一次“模型半途而废”。
这种“背锅”情形对开发者尤其重要。如果评估体系只看最终结果,把环境导致的终止算在模型头上,就会系统性低估模型能力,也会误导提示词与工具链的调优方向。
Anthropic 愿意把这一层细节讲清楚,本身也说明智能体可靠性已经成为头部厂商竞争的焦点之一。模型再强,一旦被工具链和会话管理拖住,用户体验到的仍然是一次失败的任务。
对正在搭建 Agent 产品的团队来说,最直接的动作是补齐可观测性:记录一次会话由谁、以什么原因结束,结束前还剩多少上下文,并把“模型停止”与“程序停止”分开统计。只有把这两类终止区分开,才能判断该修的是提示词、工具设计,还是外层流程本身。
需要说明的是,目前公开的信息仍集中在行为解释层面。外界尚不清楚这一现象在多大比例的任务中出现,也不清楚后续版本是否会调整会话管理与终止策略。
接下来值得看两点:官方是否会在文档或工程说明中给出更完整的交代,以及开发者社区能否基于这套解释,把“任务跑到一半就停”从模糊吐槽变成可复现、可修复的工程问题。对使用者而言,先分清责任方,再谈模型行不行,可能是这轮讨论留下的最实际的一条经验。
为什么重要
影响:Anthropic 的解释把一类智能体失败从“模型能力不足”重新归因到运行环境,这会改变团队评估模型、记录会话与排查故障的方式。在把一次中断算作模型短板之前,先确认那是模型的决定,还是程序替它做的决定。
附近消息
全部09/26 21:54
轮到谷歌踩油门了!Gemini 4泄漏、TPU上天、工程师因「太快」辞职 手机新浪网
据 news.google.com 消息,轮到谷歌踩油门了!Gemini 4泄漏、TPU上天、工程师因「太快」辞职 手机新浪网。轮到谷歌踩油门了!Gemini 4泄漏、TPU上天、工程师因「太快」辞职 手机新浪网
09/26 20:20
Replit 扩展 AI Agent 可用模型,并加深与 Meta 生态的整合
据 TipRanks 报道,Replit 正在扩展其 AI Agent 可调用的模型阵容,同时进一步加深与 Meta 生态的整合。两项动作指向同一个方向:让编程智能体拥有更多底层模型选择,并进入更广泛的开发环境与产品链路。
09/26 19:00
牛津大学允许 OpenAI 用博德利图书馆馆藏训练 AI 模型
据《卫报》报道,牛津大学已允许 OpenAI 使用其博德利图书馆的馆藏内容来训练人工智能模型。这一安排把欧洲历史最悠久的学术图书馆之一纳入了大模型训练语料,也让文化遗产机构与 AI 公司之间的授权边界再次成为焦点。
09/26 18:51
YTL AI Labs 与 NVIDIA 做出 135 万条合成样本,让 AI 更懂马来西亚
Tech Critter 报道,YTL AI Labs 与 NVIDIA 合作制作了约 135 万条合成样本(报道标题以 1.35M “fakers” 描述),目标是让 AI 模型更好地理解马来西亚。这一做法指向一个长期存在的问题:马来西亚的语言与人群特征,在通用模型的训练数据中覆盖不足。