投稿
新格
新品测评
机圈热点
企业出海
自贸区观察
创投圈
滚动
专题
榜单
4K高清
图说
商务合作
用户登录
用户注册
首页
7X24
视频
大模型
文娱
酒旅
游戏
科技
汽车
时尚
消费
医药
基金
券商
金融
保险
银行
地产
航空
能源
教育
IPO
首页
7X24
视频
大模型
文娱
酒旅
游戏
科技
汽车
时尚
消费
医药
基金
券商
金融
保险
银行
地产
航空
能源
教育
IPO
首页
>
滚动
比亚迪AI团队首次曝光!哈工大机器人基因亮眼,大模型首发即SOTA
比亚迪AI团队首次曝光!哈工大机器人基因亮眼,大模型首发即SOTA
2026-07-29 滚动 来源:另镜
7
摘要:这家年销量全球领先的新能源车企,正在展示过去并不显性的能力——物理AI的基础模型研发。
【另镜网】连比亚迪都开始发AI论文了!
而且不是成果平平的灌水文章。
最新公开的一篇HyWorldVLA,来自比亚迪汽车新技术研究院,瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action(VLA)+ World Model(世界模型)。
HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩,PDMS达到 90.59。
太反差了!
过去几年,外界提到比亚迪智能化,更多想到的是“天神之眼”、供应链整合、规模化落地,当然还有今年的“兜底”。
但要让你具体callback一下,迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。
甚至有传言比亚迪智能发布会的PPT,都是供应商帮忙做的。
但这篇论文一出,让所有人看到一个基因都完全不一样的比亚迪:
不但有自动驾驶成果,还有一支长期投入物理AI基础模型的研发团队。
HyWorldVLA想解决什么?
先说这篇论文到底在研究什么。
HyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线:
让AI从“识别道路”走向“理解世界”。
因此,近几年行业开始探索端到端自动驾驶模型,模型直接从传感器输入,输出车辆控制或轨迹,而进一步的发展,就是加入世界模型(World Model)。
简单理解,世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么,还能预测未来:几秒后道路会如何变化?其他交通参与者可能如何行动?车辆应该采取什么策略?
这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。
但问题是,目前的自动驾驶世界模型仍然面临一个核心矛盾:
既想让模型理解真实世界的细节,又希望模型能够高效推理。
一种方式是Pixel-level World Model,也就是直接预测未来视频画面。优势是直观,模型可以生成未来道路、车辆、环境变化。但缺点也明显:计算成本高,而且容易受到视觉噪声影响。
另一种方式是Latent World Model,也就是在压缩后的隐藏空间中预测未来。这种方法效率更高,更适合大规模模型训练。但问题是:模型可能理解了抽象关系,却丢失了真实世界细节。
HyWorldVLA提出的,就是一种混合世界模型(Hybrid World Modeling),留视觉世界模型对于环境细节的理解能力,又利用隐空间模型提升推理效率。
在此基础上,论文进一步引入Vision-Language-Action(VLA)模型,让系统不仅能够理解视觉环境,还能够结合语义信息生成驾驶动作。
把两条路的好处都拿到,同时把各自的短板规避掉,最终形成:看见环境、理解环境、预测未来、采取行动的端到端流程。
效果如何?
HyWorldVLA选择的测试平台,是当前自动驾驶研究领域较受关注的公开基准:NAVSIM v1。
和传统视觉任务测试并不一样,它更关注:如果车辆真的按照AI规划路线行驶,会不会安全、高效完成驾驶任务。
因此,它采用了更接近实际驾驶质量的综合指标PDMS(Predictive Driver Model Score)。其中包括是否发生责任碰撞;是否保持在可行驶区域;是否保持合理安全距离;是否完成驾驶目标;车辆运动是否平顺舒适。
也就是说,一个模型不能靠“慢慢开”获得高分,也不能只追求速度而忽略安全,需要同时做到:安全、效率、舒适。
HyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩,达到公开结果中的领先水平。
这说明:至少在公开数据集和仿真驾驶环境中,比亚迪这套基础模型具备当前自动驾驶研究前沿能力。
但需要客观看待:benchmark领先,不等于已经完成量产自动驾驶。
所以,比亚迪自动驾驶大模型SOTA,更准确的意义是:
比亚迪证明了自己具备多模态、物理AI基础模型研究能力。
怎么做到的?
HyWorldVLA的混合不是简单地把两条路线拼接在一起,而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。
第一步:训练一个视频压缩器。
先用视频VAE把连续的视频帧压缩成紧凑的隐特征,后续模型在这个压缩空间里做预测,而不是在原始像素空间里硬扛噪声。为了提升压缩质量,编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节,显著改善了重构画面的清晰度。
第二步:预训练。 把图像、动作、语言和隐特征全部转成统一的离散token,拼成一个长序列,用自回归的方式让模型学会预测下一个token是什么。
这个阶段的关键设计是“两条腿走路”——模型同时做两件事:预测未来画面的token,以及预测未来隐特征。画面token预测相当于一个“监工”,逼迫隐空间必须保留足够的信息才能还原出清晰的画面,防止表征在学习过程中变得空洞无用。
第三步:联合微调。 到了这一步,模型不再预测画面,只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。
论文验证了两种动作模块——一种是从候选轨迹里打分选最优,一种是用生成模型直接输出连续轨迹——两者都有提升,说明这套方法的增益不依赖特定的动作设计。
那SOTA到底靠什么赢的?消融实验给出了答案。
最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间,PDMS从90.59掉到87.50——这是所有消融里跌幅最大的,说明像素级的精细监督对整体表现至关重要。反过来,去掉隐空间、只保留像素级模型,PDMS也掉到89.91。两条路线谁都不能少,单靠一条都到不了90.59。
隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征(λ₃=0),PDMS只有90.17;给一个适中的权重(λ₃=0.1),达到最优90.59;权重继续加大反而掉到89.75。这说明:适度约束能防止预训练学到的语义在微调中被冲掉,但约束太强又会束缚模型自己去发现对开车最有用的表征。
噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65,DriveVLA-W0也只有61.18;HyWorldVLA达到86.87。这个差距说明:在恶劣天气下,在压缩空间里做推理远比在像素空间里死磕要可靠得多。
一句话总结:这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”,让它保留足够的环境信息;微调时切换到纯隐空间推理,自动获得了对雨雾光照的免疫力。
两个阶段分工明确,互不干扰,而不是让一个模型同时扛两项任务。
HyWorldVLA代表的是自动驾驶基础模型探索方向,与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势,但选择了VLA与混合世界模型结合的具体技术路径,有自己的差异化侧重。
但距离真正大规模量产部署,仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。
重新认识比亚迪AI:论文背后是一支什么样的团队?
HyWorldVLA这篇论文完全由比亚迪汽车新技术研究院(也就是原来的规划院,杨东生领导)独立完成,没有外部高校或研究机构合作署名,这在车企AI论文中不算常见。
顺着“新技术研究院”这条线,再把范围扩大到整个比亚迪关联去扩大检索,可以发现一些更完整的信息。
HyWorldVLA是比亚迪第一篇多模态基础模型论文,但不是第一篇AI论文。
至少还有一篇EMoE-Planner(基于混合专家的自动驾驶规划模型),发表于2025年。
其他的论文还包括赛车轨迹优化(Global minimum time trajectory planning considering curvature and distance for track racing)、胎噪判断地形(Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle)。
但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。
而再往前,公开渠道几乎查阅不到比亚迪的AI学术论文。
这在一定程度上证明,比亚迪对于核心的AI基础模型研究,是近几年才开始做的。
几个高频出现的名字,也印证了这种判断。
Liulong Ma,资料不多,github上极其低调,也没有个人主页和Google学术主页,但比亚迪汽车新技术研究院几篇公开AI论文中都有署名,而且是通讯作者。
第一次出现的时间点,是2025年。
再往前,Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向,与当前Physical AI技术趋势高度重合——
他出身哈工大,而且是著名的哈工大机器人技术与系统国家重点实验室,以及哈工大机电系。
从他的研究方向上推断,指导老师有可能是哈工大的赵杰教授,哈工大机器人研究所所长。
再从哈工大这条线索入手,还能够发现比亚迪AI团队更鲜明的哈工大基因。
Hongbiao Zhu,前面提到的EMoE-Planner第一作者,2025年论文发表时,也隶属比亚迪汽车新技术研究院,但是他的过往履历,同样紧密关联哈工大,以及CMU。
说明BYD新技术研究院的AI团队,不是单纯招聘汽车算法工程师,而是在吸收顶尖名校的计算机、机器人人才,包括哈工大、CMU,形成一个“机器人AI派”的团队。
最后,总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。
第一,时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner,2026年有HyWorldVLA,中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。
这表明比亚迪内部有一个稳定运转的基础AI研究小组,而非项目制的阶段性投入。
第二,学术圈露出的团队成员背景高度集中,鲜明的哈工大和CMU背景。
第三,这与比亚迪同时在推进的自研机器人项目形成了呼应。
据公开信息,比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线,本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。
比亚迪这个AI团队,和其他车企最大的不同在于,不是从汽车电子或ADAS工程延伸过来的研发路线,某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。
这是物理AI从技术出发的第一性原理,在组织架构上的反应。
所以,比亚迪发布HyWorldVLA的意义,不只是多了一篇论文。
它让外界第一次看到:这家年销量全球领先的新能源车企,正在展示过去并不显性的能力——物理AI的基础模型研发。
自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”,比亚迪显然已经认识到这一点,不过HyWorldVLA是否代表比亚迪已经进入第一梯队,还有待验证。
但至少,比亚迪是所有老牌车企中,率先摆脱“就事论事”搞智能辅助驾驶,按照AI系统能力建设团队,把研究向机器人和基础大模型推近的玩家。
评论区
登录
注册
发表评论
关于我们
版权声明
联系我们
工作机会
友情链接
服务协议
京ICP备2025130743号
Copy Right © 2025 www.demirror.cn All Rights Reserved