郭震 AI公众号:郭震AI

实时 AI 消息

Qwen上架Qwen-Drive-1.0-4B:面向自动驾驶的多模态视觉语言模型

Qwen团队在Hugging Face官方模型库上架Qwen-Drive-1.0-4B,一款参数规模为4B、面向自动驾驶场景的多模态视觉语言模型。该模型采用图像-文本到文本管线,标签覆盖运动规划、3D感知与视觉问答等任务,被视为Qwen向物理世界场景下沉的最新动作。

发布时间
Qwen上架Qwen-Drive-1.0-4B:面向自动驾驶的多模态视觉语言模型
图源: huggingface.co

9月2日,Qwen团队在Hugging Face官方模型库上架了新的多模态模型Qwen/Qwen-Drive-1.0-4B,模型页面将其标注为一次官方模型更新。

根据模型卡信息,这是一款image-text-to-text(图像-文本到文本)模型,基于transformers框架构建,权重采用safetensors格式,参数规模为4B。

从页面标签来看,模型定位十分明确:qwen_drive、autonomous-driving(自动驾驶)、motion-planning(运动规划)、3d-perception(3D感知)与visual-question-answering(视觉问答)并列出现,指向一个面向自动驾驶研究场景的多模态模型。

也就是说,Qwen-Drive-1.0-4B要把视觉感知与语言推理结合起来,让模型在理解路况画面的同时,还能对驾驶决策、运动规划与视觉问答类任务做出回应。

4B的小参数规模是这一定位的另一个关键信号:相比动辄数百B参数的通用大模型,这样的尺寸更适合在车端或边缘设备上实验与微调,也便于研究社区在真实驾驶数据上快速验证。

这延续了Qwen把大模型能力向物理世界场景下沉的路线,也再次印证视觉语言模型正在成为自动驾驶技术栈中越来越常见的一环。

接下来值得关注的是:该模型在真实道路与闭环仿真中的表现、社区围绕它展开的运动规划与3D感知实验,以及Qwen是否会顺势推出更大尺寸的Drive系列版本。

为什么重要

Qwen以4B小模型切入自动驾驶研究场景,显示多模态模型正加速走向物理世界任务。开源权重将便于研究社区在运动规划与3D感知等方向快速验证其能力,也为车端与仿真场景的落地实验提供了新起点。

微博邮件

QwenAutonomous DrivingVision-Language Model
返回实时消息

附近消息

全部

09/02 14:20

蚂蚁拿下VLDB 2026工业赛道最佳论文:OmniTable统一宽表处理35PB语料,效率提升5.6倍

据量子位报道,蚂蚁集团自研的统一宽表系统OmniTable获评VLDB 2026工业赛道最佳论文,让大模型数据工程再次成为行业焦点。这套系统以一套宽表方案处理35PB级语料,报道称处理效率较以往流程提升5.6倍。

09/02 14:10

阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一

9月2日,阿里更新旗舰模型Qwen3.8-Max,针对编程与专业办公进行专项后训练,性能较旧版本显著提升。新版本在聚焦前端编程能力的第三方榜单CodeArena中提升22分至1691分,超越Claude Opus 5、Kimi K3等竞品,位居总榜第一。

09/02 14:10

阿里更新旗舰模型Qwen3.8-Max:CodeArena前端编程得分1691,登顶全球第一

9月2日,阿里更新旗舰模型Qwen3.8-Max,针对编程与专业办公进行专项后训练,使其在CodeArena前端编程(WebDev)榜单上提升22分至1691分,超越Claude Opus 5、Kimi K3登顶全球第一。新版每百万Tokens综合平均成本约5美元,已上线千问AI平台API,千问办公、Qoder与千问APP同步接入。

09/02 14:06

前字节强化学习专家孙鹏博士加盟星尘智能,补齐Physical AI全栈技术布局

量子位9月2日报道,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能。这家聚焦Physical AI的公司正借此完善全栈技术布局,强化学习大将的加盟被视作补齐关键拼图的一步。