实时 AI 消息
Anthropic开发"雅可比透镜"技术,首次清晰揭示Claude推理中的隐藏思维空间
Anthropic研究人员开发了一种名为"雅可比透镜"(Jacobian lens)的新技术,以前所未有的清晰度观察大型语言模型回答问题或执行任务时的内部运作。研究发现了从平凡到令人不安的多种内部行为模式。

Anthropic的研究人员近日开发了名为"雅可比透镜"(Jacobian lens)的创新技术,据MIT Technology Review报道,该技术让他们获得了迄今为止最清晰的视角,能够观察大型语言模型在回答问题或执行任务时内部到底发生了什么。
大型语言模型长期以来被视为"黑箱"——输入进入,输出产生,但中间的推理过程几乎不可见。Anthropic的雅可比透镜技术通过数学变换,将模型内部的隐藏状态空间映射为可理解的概念表征,使研究人员能够看到Claude在处理问题时"思考"了哪些概念。
研究结果既有平凡的发现——模型确实在按照预期的方式处理信息——也有一些令人不安的观察。研究人员能够看到模型在形成最终答案之前"纠结"于不同概念的过程,这为理解AI系统如何推理提供了前所未有的窗口。
这项研究是Anthropic在AI安全与可解释性领域持续投入的最新成果。作为一家以"安全优先"为核心理念的AI公司,Anthropic一直致力于打开AI系统的"黑箱",以确保这些系统按照人类预期的方向发展。雅可比透镜的诞生标志着可解释性研究向前迈进了一大步。
从行业视角来看,随着AI系统在医疗、金融、法律等高风险领域的应用日益广泛,理解模型内部决策机制的需求变得越来越迫切。监管机构和企业用户都要求更高的透明度,而雅可比透镜这样的工具可能成为未来AI审计和合规的重要基础设施。
接下来值得关注的是,Anthropic是否会将该技术开源或与其他研究机构共享,以及这项技术能否扩展到更大型的模型和更复杂的任务场景。可解释性技术的进步,将在很大程度上决定AI系统在关键领域的信任度与采纳速度。
为什么重要
雅可比透镜是AI可解释性领域的突破性进展,为理解和审计大模型内部决策提供了全新工具,对高风险管理场景下的AI可信度和监管合规具有深远意义。
附近消息
全部07/10 03:05
《纽约时报》指控 OpenAI 在 ChatGPT 版权案中隐藏证据
《纽约时报》等新闻出版商指控 OpenAI 在版权诉讼中隐藏了可用于识别 ChatGPT 输出中受版权保护新闻报道的工具和数据集。原告已向法院提交新的制裁动议,要求追究 OpenAI 的证据隐瞒行为。
07/10 02:54
借助 AI 编程工具 Cursor、SpaceX 取得多项 AI 技术进展
据新浪财经报道、SpaceX 借助 AI 编程助手 Cursor 在多项 AI 技术研发上取得了显著进展。这展示了 AI 编程工具在航空航天等尖端科技领域的实际应用潜力。
07/10 06:03
OpenAI关停AI浏览器Atlas,但Agent浏览功能将转移至桌面应用
OpenAI正在关停其AI浏览器Atlas,这款产品上线不到一年即被叫停。不过,Atlas的部分Agent式浏览功能将被迁移到OpenAI桌面应用和Chrome扩展中。
07/10 02:40
Google将标注由AI生成或编辑的广告
Google宣布将在广告中增加新的标识,告知用户哪些广告使用了生成式AI工具进行创建或编辑。这是科技巨头在AI内容透明度方面的又一重要举措。