比亚迪 AI 团队首秀:混合世界模型 HyWorldVLA 获 90.59 分,自研芯片 + 算法闭环成型

浏览8次 点赞0次 收藏0次

8 月 12 日消息,比亚迪汽车新技术研究院 AI 团队上个月发表了其首篇研究论文,介绍了一种用于自动驾驶的混合世界模型 HyWorldVLA。该模型结合了像素级和潜在空间世界建模,并采用视觉-语言-动作(VLA)架构。

该模型在自动驾驶公开基准测试 NAVSIM v1 中取得了 90.59 的 PDMS 评分,刷新了该基准的历史最佳成绩。在指标更全面的 NAVSIM v2 上,HyWorldVLA 同样取得了 89.71 分的领先成绩。

注:PDMS 指标综合考察碰撞安全性、可行驶区域合规性、安全距离、目标完成度和运动舒适性等多维度实际驾驶质量。

HyWorldVLA 的核心思路是“两条腿走路”。像素级世界模型逐帧预测未来路况,细节丰富但计算昂贵、对视觉噪声敏感;潜在空间模型在压缩的抽象表征中运行,效率高却容易丢失关键细节。比亚迪的方案在训练阶段用像素级监督充当“看门狗”,强制潜在空间保留足够的环境信息,实际推理时则只用轻量的潜在空间模型保证效率。

消融实验验证了两者缺一不可:移除像素级预测,PDMS 从 90.59 跌至 87.50;移除潜在空间处理,则降至 89.91。在 655 个雨雾噪声场景测试中,HyWorldVLA 得分 86.87,比最强基线高出 19 分以上。

今年 5 月 28 日,比亚迪发布了中国首款 4nm 车规级智驾芯片“璇玑 A3”。该芯片采用 4nm 制程,集成 16 核 CPU,DMIPS 达 420K,带宽 273GB/s,达到 ASIL-D 最高功能安全等级。单颗芯片算力约 700TOPS,支持三颗芯片并联,整车智驾算力最高可超 2100TOPS。从算法到芯片的完整闭环,被视为比亚迪为 L3 级自动驾驶进行的关键技术储备。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯