众力资讯网

阿里千问又在自动驾驶领域放了个开源大招。本周正式开源 Qwen-Drive-1.

阿里千问又在自动驾驶领域放了个开源大招。本周正式开源 Qwen-Drive-1.0-4B,这是基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型,官方称是首个面向自动驾驶的视觉语言基础模型,这个定位真的很有野心。

这个模型的核心思路很有意思。预训练阶段就统一了 3D 感知和视觉问答,然后进一步扩展到运动规划,而且完全保留了预训练 VLM 的原始架构。也就是说,它不是为了自动驾驶重新做了个模型,而是在通用大模型的基础上把驾驶能力长出来了,这个思路和传统自动驾驶管线完全不同,更接近端到端的方向,也是行业未来的大趋势啊。

训练方案上分阶段进行,把驾驶监督和通用视觉语言数据结合起来。这样做的好处是,在获得驾驶特定能力的同时,还能保留通用视觉理解和指令遵循能力,不会变成只会开车的偏科模型,遇到复杂场景还能调用通用知识来应对。

模型同时提供 SFT 和 RL 两个规划专家。官方评测覆盖很全面,评估非常严谨,包括 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

数据方面也很有特点。仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,从开环预测到闭环驾驶进行全面评估。SFT 模型在所有基准上已经具备竞争力。经过强化学习后,模型只付出了微小的开环位移误差代价,换来了人类偏好对齐和闭环安全性的全面提升,这个 trade-off 做得很聪明,用小代价换大提升。

做科技媒体观察下来,Qwen-Drive 的意义不只是又一个自动驾驶模型。它代表了一个趋势:自动驾驶正在从专用感知规划管线走向通用视觉语言模型路线。用大模型统一 3D 感知、场景理解和运动规划,这个思路如果跑通,会大幅降低自动驾驶的研发门槛,让更多团队能参与进来。4B 的参数量也很友好,部署门槛不高,边缘设备也能跑,对量产落地很友好。

而且千问选择开源,等于把这个能力开放给整个行业。之前自动驾驶公司都在各自为战,现在有了开源基础模型,中小团队也能站在巨人肩膀上做创新,完全不用从零开始。自动驾驶的开源生态,可能会因为这个模型进一步繁荣啊朋友们真的!!!

阿里千问自动驾驶视觉语言模型开源模型前沿在线