郭震 AI公众号:郭震AI

实时 AI 消息

Anthropic开发"雅可比透镜"技术,首次清晰揭示Claude推理中的隐藏思维空间

Anthropic研究人员开发了一种名为"雅可比透镜"(Jacobian lens)的新技术,以前所未有的清晰度观察大型语言模型回答问题或执行任务时的内部运作。研究发现了从平凡到令人不安的多种内部行为模式。

发布时间
Anthropic开发"雅可比透镜"技术,首次清晰揭示Claude推理中的隐藏思维空间
图源: technologyreview.com

Anthropic的研究人员近日开发了名为"雅可比透镜"(Jacobian lens)的创新技术,据MIT Technology Review报道,该技术让他们获得了迄今为止最清晰的视角,能够观察大型语言模型在回答问题或执行任务时内部到底发生了什么。

大型语言模型长期以来被视为"黑箱"——输入进入,输出产生,但中间的推理过程几乎不可见。Anthropic的雅可比透镜技术通过数学变换,将模型内部的隐藏状态空间映射为可理解的概念表征,使研究人员能够看到Claude在处理问题时"思考"了哪些概念。

研究结果既有平凡的发现——模型确实在按照预期的方式处理信息——也有一些令人不安的观察。研究人员能够看到模型在形成最终答案之前"纠结"于不同概念的过程,这为理解AI系统如何推理提供了前所未有的窗口。

这项研究是Anthropic在AI安全与可解释性领域持续投入的最新成果。作为一家以"安全优先"为核心理念的AI公司,Anthropic一直致力于打开AI系统的"黑箱",以确保这些系统按照人类预期的方向发展。雅可比透镜的诞生标志着可解释性研究向前迈进了一大步。

从行业视角来看,随着AI系统在医疗、金融、法律等高风险领域的应用日益广泛,理解模型内部决策机制的需求变得越来越迫切。监管机构和企业用户都要求更高的透明度,而雅可比透镜这样的工具可能成为未来AI审计和合规的重要基础设施。

接下来值得关注的是,Anthropic是否会将该技术开源或与其他研究机构共享,以及这项技术能否扩展到更大型的模型和更复杂的任务场景。可解释性技术的进步,将在很大程度上决定AI系统在关键领域的信任度与采纳速度。

为什么重要

雅可比透镜是AI可解释性领域的突破性进展,为理解和审计大模型内部决策提供了全新工具,对高风险管理场景下的AI可信度和监管合规具有深远意义。

微博邮件

AnthropicClaudeInterpretabilityJacobian Lens
返回AI日报

附近消息

全部