智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

从理解世界到预测未来,千里智驾开源JEPA原生世界—动作模型

2026-09-18来源:ITBEAR编辑:瑞雪
WA-JEPA 论文首页

近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学发布并开源世界—动作模型WA-JEPA,为自动驾驶模型如何理解场景、预测未来并生成驾驶动作,探索了一条新的技术路径。

当前,部分自动驾驶世界模型通过生成未来视频来学习环境变化。这类方法能够呈现直观的未来画面,但也需要投入大量计算资源还原纹理、光影等视觉细节。WA-JEPA没有把“生成逼真的未来画面”作为目标,而是基于V-JEPA的视频语义表征能力,在高维隐空间中预测道路结构、交通参与者关系及运动趋势等与驾驶规划更相关的信息。

图2 Flow Matching 能够预测更清晰的时序变化

针对原始V-JEPA并非为自动驾驶规划设计的问题,WA-JEPA进行了三项关键改造:通过未来掩码预训练,让模型根据历史画面推演尚未发生的场景变化;其次,引入条件流匹配,学习未来表征从噪声到目标状态的变化过程,降低确定性回归容易产生“平均化预测”的问题;将未来场景表征与自车动作放入同一预测器中联合生成,让模型在预测世界变化的同时规划车辆轨迹。

图3 WA-JEPA让未来预测服务于驾驶规划

WA-JEPA整体包含约4.81亿个可训练参数,在世界模型研究中保持了相对紧凑的规模。其第一阶段训练只需连续驾驶视频,不依赖目标检测、语义分割等额外人工感知标注,有助于更充分地利用大规模驾驶数据。

在论文采用的统一评测协议下,WA-JEPA在NAVSIM-v2开环规划基准中取得91.7 EPDMS,较对比实验中的最强端到端基线和最强世界—动作模型基线分别提升1.6和1.3。在HUGSIM的436个闭环场景中,模型未经针对性训练或微调,取得0.4462 HD-Score,为同一复现协议下的最佳结果,展现出一定的零样本迁移能力。

WA-JEPA开环闭环双冠军成绩

目前,千里智驾已同步开放论文、代码、模型权重及评测流程,希望为世界—动作模型在自动驾驶领域的复现、比较与后续研究提供公开基线。

附录:

项目主页:https://wa-jepa.github.io/

代码:https://github.com/AFARI-Research/WA-JEPA

模型权重:https://huggingface.co/AFARI-Research/WA-JEPA

论文:https://arxiv.org/abs/2608.20974

数字能源新引擎:人工智能算力飙升 全国日均Token调用量两年千倍跃升
IT之家注:Token(词元)是计算机科学与自然语言处理领域中的一个基础且重要的概念,通常指文本数据经过分词或标记化处理后的最小单位,其中单位可以是单词、标点符号、数字或其他任何有意义的符号。词元调用量不仅…

2026-09-17