Qwen-Drive 1.0 会告诉你为什么刹车,但别指望解释和实际驾驶动作对得上。

阿里发布新一代自动驾驶基础模型 Qwen-Drive 1.0,把三维空间感知、交规问答和路径规划塞进同一个模型。但论文自己承认,它给出的刹车解释与实际驾驶动作经常对不上。

一句话看懂:阿里发布新一代自动驾驶基础模型 Qwen-Drive 1.0,把三维空间感知、交规问答和路径规划塞进同一个模型。但论文自己承认,它给出的刹车解释与实际驾驶动作经常对不上。

事件核心:发生了什么

阿里研究团队在 Qwen3.5-4B(今年二月发布)基础上构建了 Qwen-Drive 1.0,新增两个独立模块:一个负责将摄像头画面重建为鸟瞰三维地图,识别车辆、行人、道路标线和占用区域;另一个负责规划未来几秒的行驶路线。该模型同时承担驾驶决策与座舱语音助手的角色,无需为两类场景分别部署模型。

论文强调,单纯的文本-图像模型并不天然具备空间理解能力。团队只训练新增模块时,感知精度始终偏低;只有同时微调视觉语言模型本身的空间任务表现,精度才有显著提升。这证实空间感知必须被显式地训练出来,而非依赖预训练模型的隐含能力。为防止模型在驾驶数据微调中遗忘通用知识(即“灾难性遗忘”),团队整合了 24 个公开交通场景数据集,并引入 AI 模型统一各数据集的问答格式,再补充了“为何刹车”等因果解释样本。在模拟器评测中,经强化学习优化的版本将车辆偏出道路的概率从 24% 降至 12%。

为什么重要

Qwen-Drive 1.0 的技术路线与主流方案差异明显。现有自动驾驶模型普遍的做法是先取通用视觉语言模型,用交通问答对微调——这导致两个后果:模型能描述画面却测不准距离,以及过度专业化造成通用知识退化。Qwen-Drive 的设计用一个共享语言模型同时驱动三维建图、路径规划和座舱对话,目标直指智能座舱与自动驾驶域控制器融合的趋势。如果这个架构验证可行,意味着车厂无需在车载系统上跑两套独立模型和两份算力开销。

但论文也如实披露了解释不一致的问题:模型给出的刹车理由与实际决策依据并非总是一致。换言之,可解释性目前只是伪装成解释的表面文本,实际驾驶逻辑仍是不透明的。这一局限对行业有警示意义:不要盲目相信模型口头给出的决策理由——当模型把“解释”变成一种语言任务时,它可能只是在生成用户预期中的回答,而非忠实还原决策机理。

对用户/开发者/创作者的影响

对车企与自动驾驶方案商来说,Qwen-Drive 1.0 提示了一种路径:与其为驾驶场景重训一个专用模型,不如在同一基座模型上叠加空间感知模块。目前论文尚未公开模型权重,但 Qwen 系列一贯有开源先例,若后续放出开源版本,中小型研发团队将能直接在其上做场景适配,降低自研空间感知模块的工程门槛。对座舱交互开发者,该模型展示了一体化方案的可行性:同一参数集合既能做驾驶规划,又能处理乘客的开放式问答,省去双模型架构的数据对齐与维护成本。普通用户则需要留意,车载系统演示“它解释了为何刹车”并不等于系统真正“理解”了路况——这类解释目前更多是面向乘客的叙事功能,而非安全依据。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,模型权重是否正式开源、何时发布到 Hugging Face 或 ModelScope,将直接决定技术影响力扩散速度。第二,论文承认解释与动作不一致的问题,团队后续是否引入链式推理约束或因果建模来缩小差距,值得追踪——这是从仿真演示走向量产前装的关键障碍。第三,阿里在自动驾驶基础模型上的投入能否与 Qwen 系列的语言模型迭代节奏同步,决定了该技术是否能成为其 AI 生态中除云端大模型之外的又一个增长点。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 22221

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注