郭震 AI公众号:郭震AI

实时 AI 消息

智谱开源GLM-4.1V-9B-Thinking视觉语言模型,引入思维链推理能力

智谱AI在Hugging Face上正式发布了开源视觉语言模型GLM-4.1V-9B-Thinking,该模型引入了思维链推理范式,在28项基准测试中有23项达到10B参数量级最佳表现。这一模型基于GLM-4-9B-0414基座模型开发,支持64K上下文长度和最高4K分辨率图像输入。

发布时间
智谱开源GLM-4.1V-9B-Thinking视觉语言模型,引入思维链推理能力
图源: huggingface.co

智谱AI团队于7月22日在Hugging Face平台正式发布了新一代开源视觉语言模型GLM-4.1V-9B-Thinking。该模型基于GLM-4-9B-0414基座模型研发,首次在该系列中引入了链式思维推理范式,使模型在复杂视觉理解任务中展现出显著提升的准确性和可解释性。

与上一代CogVLM2和GLM-4V系列相比,GLM-4.1V-9B-Thinking的核心创新在于其"思考范式"设计。通过强化学习训练,模型能够在回答问题前生成中间推理步骤,从而大幅提升数学推理、多步问题求解和复杂场景理解的准确性。研究团队表示,这是该系列中首个以推理能力为核心的视觉语言模型。

在性能方面,GLM-4.1V-9B-Thinking展现出令人瞩目的表现。在28项基准测试中,它在23项上达到了10B参数量级模型的最佳成绩,甚至在18项任务上超越了72B参数规模的Qwen-2.5-VL-72B。这一跨越两个数量级的性能优势,标志着小参数模型通过推理增强可以实现对大规模模型的弯道超车。

该模型支持64K的长上下文窗口,能够处理任意宽高比的图像输入,并支持最高4K分辨率。它同时支持中英双语,为全球开发者提供了灵活的应用基础。模型在Hugging Face上发布仅数小时就获得了44万以上的下载量和近800个点赞,反映出社区的强烈关注。

智谱团队还同步开源了基座模型GLM-4.1V-9B-Base,以便研究社区在此基础上进一步探索视觉语言模型能力边界。模型可通过Transformers库直接加载使用,也支持vLLM和SGLang等推理框架部署。

GLM-4.1V-9B-Thinking的发布标志着开源视觉语言模型进入推理增强时代。在过去一年中,推理能力主要在纯语言模型上取得突破,而这一模型将思考范式引入多模态领域,为复杂问题求解、长上下文理解和多模态智能体等应用场景提供了新的技术路径。

值得关注的是,该模型在展示强大能力的同时,也提出了新的问题:推理增强是否会导致视觉语言模型的部署成本上升?如何在有限的算力资源下平衡推理深度和响应速度?这些可能成为开源社区接下来讨论的重点。

为什么重要

GLM-4.1V-9B-Thinking以9B参数量实现了超越72B模型的表现,验证了推理增强路径在小模型上的有效性,将推动开源视觉语言模型向推理优先方向演进。

微博邮件

Zhipu AIGLMVision-Language ModelOpen SourceReasoning
返回实时消息

附近消息

全部