X-Foresight(PWM Team, XPeng Inc., arXiv:2605.24892, v3 2026-06-08)是小鹏 GWM (Generative World Models) 谱系的第三块拼图。前两块——X-World 把 production-grade 多相机驾驶世界模型从话题做成了可对照的工程对象,X-Cache 把它的推理 wall-clock 压到闭环可承受。X-Foresight 解决的是怎么把这套世界模型真正接进 VLA 策略训练循环里——它的命题是把 world model 直接嵌进 VLA 主干联合训练,让同一张网络同时输出 chunk-wise 未来视频和 ego action,跟之前"世界模型当外部数据生成器"的解耦范式分道扬镳。

paper 的命题在摘要里讲得很直接:predictive world modeling 是给 VLA 加 forward-looking 能力的标准路径,但简单做 next-frame prediction 会撞上两堵墙——视频 token 低熵冗余让训练退化成 trivial 外推;瞬时动力学要求密集帧、长程因果要求长 horizon,单一时间分辨率两头都顾不到。X-Foresight 用四招同时解:long-horizon chunk-wise auto-regressive 替代 next-frame;curriculum 把 inter-chunk stride 从 1 秒渐进推到 3 秒;temporal importance sampling (TIS) 把训练预算压到 safety-critical chunk;diffusion renderer 解耦让 LDM 输出的 camera token 是 plausible futures 的低熵 summary、不浪费 capacity 学 pixel detail。

读者预设:通读过 X-World 那篇精读(架构、Rectified Flow 训练、view-temporal SA),知道 Dense Latent Predictive Supervision 那篇里 “latent 比 pixel 好” 的论证。本文不会重复这两条。

一、问题域:video-based world modeling 的两堵墙

要看清 X-Foresight 在解什么,先把它要绕的两堵墙立起来。

墙 1:视频 token 低熵冗余。语言模型 next-token prediction 之所以 work,是因为文本 token 语义离散、熵高、相邻 token 几乎独立——预测下一个词需要真的从上下文里抽信息。视频 token 完全相反:相邻帧之间像素级差异极小,4Hz 采样下两帧之间车体只挪几个像素、纹理几乎不动。一个 next-frame predictor 直接把 tt 帧 copy 到 t+1t+1 帧、配一点点小扰动,L2 loss 就会非常低——但模型什么因果都没学到,只学会了 trivial extrapolation。这是 video-based world modeling 跟 LLM 共用 AR 框架时最容易踩的坑,也是为什么 Sora 这一类 pixel-level 视频模型走 diffusion 路线、而 Genie 这类 world-model 路线必须做 token-level 重 design。

墙 2:时间 dilemma。世界模型同时要 model 两类时间结构:

  • 瞬时动力学 (instantaneous dynamics)——刹车制动响应、转向跟随、cut-in 启动瞬间,这些发生在数百毫秒尺度,需要密集帧才能抓住;
  • 长程因果 (long-term causality)——多出口环岛要在 200 米外就根据导航选 lane、红灯还有 3 秒切绿灯所以现在不必急刹,这些发生在 5-10 秒尺度,需要长 horizon 才能展开。

单一时间分辨率两头都顾不到。密集采样到 12Hz 训 10 秒就 120 帧 × 7 路相机,token 数量爆炸;稀疏采样到 1Hz 训 10 秒只有 10 帧,瞬时动力学完全 alias 掉。这条 dilemma 在 paper 里被反复强调,是 chunk-wise 设计的根本动机。

附加约束:VLA 不能只 react。当前主流 VLA 架构(包括小鹏自家的 VLA 2.0,paper §1 直接点名)是 fundamentally reactive 的——只看历史观测出动作,没有 forward simulation 的内部机制。模型遇到危险只能临场反应,不能像人类司机一样"我知道前面那辆车要变道、所以现在就该松油门"。X-Foresight 的整个命题是把 predictive world modeling 嵌进 VLA architecture,让模型在出动作之前先在 latent 空间里"想象"几秒钟未来。

二、第一招:Chunk-wise Auto-Regressive

paper Figure 5 给的五种 prompt formulation 对照是整篇方法论的核心,按递进关系展开:

形式描述问题 / 优点
(a) Frame-wise foresight每步预测下一帧训练信号弱,相邻帧几乎一样,墙 1
(b) Frame-wise longer foresight (s=4)时间下采样后帧级预测抓不到瞬时动力学 (motion cue alias)
(c) Chunk-wise foresight (K=4)每步预测下一个 K 帧 chunk短期结构保留 + 长 horizon 信号
(d) Chunk-wise longer foresight (K=4, s=12)chunk 之间留 stride,跨大间隔预测horizon 拉长但计算量不爆炸
(e) Chunk-wise + temporal importance sampling在 (d) 基础上按 importance 选位置训练预算转向 safety-critical

(c) → (d) → (e) 是 X-Foresight 的实际配置链。

chunk 内 vs chunk 间的非对称设计。chunk 内是 1 秒 / 4 帧的密集结构,model 每步看到完整的瞬时动力学;chunk 间通过 stride 在时间上跳过去——预测目标是 3 秒之后那个 chunk,而不是 接下来 1 秒。这等于把 model 强迫训练到"跨语义距离的 chunk 之间做预测",从根上破掉 trivial extrapolation——3 秒后场景跟现在差异足够大,copy-paste 策略 loss 会爆。同时密集 intra-chunk frame 保住瞬时动力学不丢。两堵墙一起翻。

action 跟 observation 的非对称。这条很关键:observation target 在 stride 上预测(3 秒后那个 chunk),但 action 仍然是 immediate next step。理由是闭环 control 必须输出 dense、unstrided 的轨迹——3 秒后那一步的方向盘转角对当下决策没意义。paper 把这个写成"asymmetric design that allows the model to learn long-horizon visual evolution while preserving the temporal resolution required for ego-action prediction"。这条不对称是 chunk-wise 框架能同时承担"world modeling 长程信号"和"closed-loop 实时 control"两个目标的关键。

跟 dense-latent 论点的咬合。X-Foresight 的 LDM 用 L2 loss regress camera token——一个 token 对应多个 plausible futures 的低熵 summary。paper §3.3.1 原话:“each predicted camera token was regressed against many plausible futures under an L2 objective, it converged to a low entropy summary of the conditional future — enough for action grounding and scene structure, but visually blurry when decoded directly”。这跟 Dense Latent Predictive Supervision 那篇的核心论点完美咬合——latent 监督的好处恰恰是 不浪费 capacity 去 model pixel-level texture,让 backbone 专注结构性世界知识。X-Foresight 把这条 spatial 维度的 dense-latent supervision,再叠了一层 temporal 维度的 chunk-wise organization。

三、第二招:Curriculum + Temporal Importance Sampling

Chunk-wise 解决了"如何设计单步预测",下面两条解决"训练时怎么排预算"。

3.1 Curriculum:1s → 3s 渐进 stride

直接训 3 秒 stride 的长 horizon 不稳定——model 还没建立短 horizon 的基础就被推到困难任务上。X-Foresight 的 curriculum 是"先 1 秒 contiguous chunk、再 3 秒 strided chunk"两阶段,论文里叫 CL(curriculum learning)和 CLEF(curriculum learning with extended foresight)。Table 2 数字:

  • Cont. H=6 baseline:collision rate 0.270%
  • +H=21, CL (1s contiguous chunk 拉长到 21 chunk):collision rate 0.238%
  • +H=21, CLEF (在 CL 基础上把 stride 推到 3s):collision rate 0.230%,lateral ADE 0.1692(最低)

CLEF 提供最强的 ADE/FDE,但 Safety 维度回退 (CL 0.9310 → CLEF 0.9387)。paper 的 honest 评价是:“progressively extending the foresight horizon stabilized trajectory prediction, though Safety regressed slightly versus CL, motivating the safety-targeted sampler in Row 4”。这是 paper 内部论证链的重要环节——CLEF 不是终点,是引出 TIS 的台阶。

3.2 Temporal Importance Sampling (TIS)

Curriculum 把 horizon 撑大了,但训练预算大头还是落在 cruise(巡航)chunk 上——那些占数据 70%、信息量最低、却被 uniform sampler 平均吃掉的 segment。TIS 的方案是按 ego trajectory 的加速度信号 给每个候选 step 算 importance score:

wk=W{W1k,W2k,W3k}maxtW(λxax(t)+λyay(t)) w_k = \sum_{W \in \{W_1^k, W_2^k, W_3^k\}} \max_{t \in W} (\lambda_x |a_x(t)| + \lambda_y |a_y(t)|)

三个时间窗口分别对应不同 maneuver 阶段:

  • W1kW_1^k near-future——刹车启动、急加速、突然变道这些即将发生的事件;
  • W2kW_2^k mid-horizon——更远一点的 maneuver commitment(左转入、刹入车位);
  • W3kW_3^k recent-history——刚刚执行完的 maneuver 余波。

每个窗口取 max 是因为 maneuver 是 瞬态 事件——窗口内只要有一个高加速度点,整个 chunk 就 safety-critical。然后 temperature-scaled 采样:

pk=wk1/τjwj1/τ p_k = \frac{w_k^{1/\tau}}{\sum_j w_j^{1/\tau}}

τ\tau 控制 distribution 锐度。再加一条工程约束:consecutive selected steps 之间最大时间间隔不超过某个上界——防止 sampled sequence 过于稀疏,让 future prediction 还能 condition 在最近的 temporal context 上。

Table 2 第 4 行:CLEF + TIS 把 collision rate 从 0.230% 进一步压到 0.216%(6.1% 相对降)。Production scale (1024 GPUs) 的 Table 3 数字更显眼——X-Foresight 完整组合 vs baseline:

  • Lat ADE 0.1675 → 0.1567 (-6.4%)
  • Lat FDE 0.4153 → 0.3789 (-8.8%)
  • Collision 0.228% → 0.191% (-16.2%)
  • Safety 维度 (-9.1%) 和 Compliance 维度 (-8.2%) 是涨幅最大的两条——正好对应"safety-critical chunk 监督加强 → safety/compliance 提升"的设计意图

3.3 不只是数据重采样

值得单独讲一句:用加速度信号做重采样在 AD 数据工程里不算新——很多团队都拿 lat/long accel 当难度代理。X-Foresight 的具体 contribution 在三个细节:(a) 三窗口 max 同时覆盖 imminent / committed / aftermath 三类时间相位,不是单一前瞻窗;(b) temperature-scaled distribution + 最大间隔约束,让重采样不至于退化成"只看长尾、丢掉常态";(c) 跟 chunk-wise + curriculum 配套使用,落到具体 prompt formulation Fig 5(e)。这三件捏在一起的 instantiation 是这一招的工程价值。

四、第三招:Diffusion Renderer 解耦

整套架构有两个组件:Large Drive Model (LDM) 做联合 world prediction + action planning(unified token space);Vision Renderer 把 LDM 输出的 camera latent token 解码成 photorealistic 多视角帧。两者职责严格分离。

4.1 为什么必须解耦

LDM 的 camera token 是 L2 regress 出的 plausible futures 平均——结构对、appearance 模糊。直接送回 vision encoder 做下一步 chunk 的 history,rollout 累积误差会快速发散,下游 perception 跟着崩。但要让 LDM 自己同时背 photorealistic synthesis 又是另一个问题——pixel detail 跟 world structure 是两类不同的信号,强行塞进一个 transformer 会让 capacity 在两边都打折。

paper 的解法直白:让 LDM 只输出"想象的 latent summary",让 diffusion renderer 单独做"把 summary 还原成 photorealistic 帧"。一个负责 imagination + control,一个负责 photorealism。renderer 直接 fork X-World 的 DiT + 3D causal VAE backbone(这就是为什么 paper §6 acknowledgments 专门 cite “sibling GWM team” on X-World)。

4.2 Renderer condition action token

这条是 X-Foresight 最关键的设计决策之一,也是最容易被忽视的一招。renderer 接受两路输入:multi-view history frames(标准 I2V 路径)+ LDM 预测的 camera tokens(cross-attention 注入)。不接受 action tokens。理由 paper §3.2.1 写得透:如果 action 也喂进来,renderer 会把它当 low-entropy shortcut 用,绕过 camera tokens 自行预测未来——LDM 跟 renderer 就 独立预测 了,闭环就破了。

camera token 是 LDM 控制 renderer 的唯一信息瓶颈。这个 bottleneck 设计有个漂亮的副作用——可以用它 audit 训练过程是否健康:把同一个 camera token 同时送进 renderer 和 一个独立的轻量 Camera Latent Decoder(§4.1.3),如果两者输出的几何结构吻合,说明 camera token 真的承载了 LDM 的 latent imagination,renderer 没瞎编。Fig 8 展示 LDM 从 action token 预测的轨迹(蓝线)覆盖在 renderer(不接受 action token)渲染的画面上,跨 6 秒 horizon 始终几何一致——这就是 audit 通过的视觉证据。

4.3 Rollout drift 处理

闭环部署下,renderer 每一步输出会变成下一步的 history conditioning,模型暴露在自己的 sample 分布而非 ground-truth 分布上——经典 exposure bias。X-Foresight 没用 CausVid / Self-Forcing 那种 distribution matching distillation,而是两个 lighter-weight 修正:latent sink 锚定一个稳定 reference context 跨 rollout 步保留;latent augmentation 在训练时给 current-step latent 加扰动,让 renderer 提前见过 perturbed conditioning。Helios 那一脉的 trick。代价小、收益清楚——Table 5:renderer 6 秒 rollout FID 从 1.51 涨到 2.84,FVD 从 11.28 涨到 29.52,drift 累积可控。

4.4 Camera Latent Decoder 作为诊断工具

这件小工具在论文里只占 §4.1.3 半页篇幅,但工程价值高于它的篇幅占比。问题是:diffusion renderer 有强生成 prior 和采样随机性,输出的画面 看起来对 不代表 latent space 结构 真的健康。renderer 能用 prior “脑补"出合理画面,掩盖 latent drift。

解法是训一个轻量、确定性、不带 generative prior 的 decoder——causal 3D ResNet + lowest-resolution 处的 spatial self-attention,progressive spatio-temporal upsampling 把 latent 还原成图。这个 decoder 出图会糊,但糊得"诚实”——latent 漂了,糊的位置就直接体现出来。它的角色是 X-Ray,不是 Photoshop。renderer + 这个 decoder 双路对照,就有了诊断 latent drift 和 multi-view alignment 问题的客观工具。

五、第四招:Semi-Causal Block-Sparse Attention

长 horizon 训练 attention 是 quadratic 瓶颈。X-Foresight 用 block sparse attention (BSA) 加针对性的 mask 设计,把 active block 数推到随 sequence length 线性增长。Table 4:BSA + 自定义 mask 把训练 per-step time 从 24.50s(FlashAttention-2 + standard causal mask)压到 15.40s,1.59× 训练吞吐

mask 设计的几条规则(Figure 6):

  • System prompt 当 sink token——所有后续 chunk 可见,提供全局 task context;
  • Chunk 内全 bidirectional——同一 chunk 里的 text / observation / action / query token 联合推理;
  • Chunk 间按位置对应做 sparse 连接——每个 chunk 内部 layout 一致,token lil_i 在每个更早 chunk 都有 positional counterpart,cross-chunk attention 限制在这个 counterpart 周围一个空间邻域,邻域 width 随 temporal distance shrink。这样保留了 spatial reasoning 又不至于全连接;
  • Query token QiQ_i 可以看所有 prompt-side history,但 不能看其它 query token (Q1:i1Q_{1:i-1})——防止预测耦合,每个 chunk 的预测必须从 ground-truth-conditioned prompt history 出发;
  • Heads 按 parity 分组——奇偶头 attend 互补的 temporal offset,这是把 active block 数从 quadratic 压到 linear 的关键 trick。

这套 sparse pattern 跟 Radial Attention(NeurIPS 2025)那一脉的 sparse 设计同源——sequence 沿语义结构分组、跨组 attention 走稀疏 pattern。在长 horizon driving 这个特定 setting 下,X-Foresight 给出了 chunk-aligned + parity-split 的具体 instantiation。

六、训练 pipeline:三阶段解耦-然后-对齐

整个模型分两个组件训三个阶段,paper Figure 4 是核心。

Stage I:LDM 单独训

teacher forcing,输入历史 multi-view + 文本 instruction + ego state,预测 future ego actions + per-camera latent tokens + auxiliary BEV map。loss 三件加权和:

Ltotal=Lact+αLcam+βLbev L_{\text{total}} = L_{\text{act}} + \alpha L_{\text{cam}} + \beta L_{\text{bev}}
  • Lact=1Ha^iai1L_{\text{act}} = \frac{1}{H} \sum \|\hat{a}_i - a_i\|_1(action L1)
  • Lcam=1HVo^ivg(Iiv)2L_{\text{cam}} = \frac{1}{HV} \sum \|\hat{o}_i^v - g(I_i^v)\|_2(camera token 跟 frozen ViT 输出的 L2,g()g(\cdot) 是 base VLM 的冻住 ViT)
  • Lbev=1Hb^ibi2L_{\text{bev}} = \frac{1}{H} \sum \|\hat{b}_i - b_i\|_2(BEV map L2,给 query token 一部分加几何监督)

这一阶段配 chunk-wise prompt + curriculum + TIS + BSA 四件套——render 部分完全不参与,省下 diffusion 训练的巨大 cost。

Stage II:Renderer 单独训

LDM 冻住,renderer 从 X-World weights 初始化,用 ground-truth ego action 做 conditioning(不是 LDM 的 camera tokens——还没到那一步)。两件 adaption:

  1. temporal alignment——X-World 是 12Hz video model,X-Foresight LDM 输出 4Hz,把 renderer 适配到 4Hz cadence;
  2. rollout drift mitigation——latent sink + latent augmentation。

optimizer 是 Muon,constant lr 8×1058 \times 10^{-5},128 GPUs,batch 1 per device。

Stage III:Renderer 跟 LDM 对齐

LDM 仍然冻住,renderer 切换 conditioning——从 ground-truth action 换成 LDM 输出的 camera tokens。X-World 原本的 action / dynamic-agent / static-element / text branch 全部移除,只剩 camera-token cross-attention 一路。loss 切到纯 rectified-flow velocity-matching LvelocityL_{\text{velocity}}(Eq. 8)。Muon + one-cycle cosine schedule,FSDP shard renderer 参数 / 梯度 / optimizer state,LDM 只跑 forward。

这套 schedule 的设计逻辑:Stage I 让 LDM 在不被 diffusion 噪声梯度干扰的情况下学好 action + 结构;Stage II 让 renderer 在不被 LDM 不稳定输出干扰的情况下学好 photorealism + 4Hz cadence + drift handling;Stage III 才把两者拼到一起、关掉 train/inference gap。三阶段都没有同时训两边——这是 decoupled-then-aligned 哲学的具体落地。

七、实验数字 + 几个值得拎出来的细节

7.1 数据规模

Figure 2 + §2:280k 小时 / 34M clip / 13.8T tokens / 7 路相机 / 12Hz native 下采样到 4Hz / 86.8% urban + 13.2% highway。Figure 3 显示场景分布——open-road lane keeping 21.0%、lane changes 20.1%、constrained-lane driving 16.0%、intersections 13.1%、obstacles & cut-ins 9.9%、following/congestion 9.6%、VRU 6.2%、rare layouts 4.1%。常规场景 ~70%,剩下 30% 给 long-tail 和 interaction-heavy。

13.8T tokens 在 driving 数据领域是 industrial scale——量级跟现代 LLM 预训练(Llama 3 15T tokens)已经在同一档。这条数字本身值得记一下:driving 这个垂直领域终于开始吃 LLM 同量级数据了。

7.2 Long-horizon scaling 不是单调收益

Table 1 (H ∈ {1, 6, 21}):

  • ADE / FDE / Coll 都随 H 单调下降(H=1 → H=21 的 Coll 0.263 → 0.245)
  • Safety 0.9481、Compliance 0.9533 单调改善——跟"长 horizon 监督帮 safety/compliance"的设计直觉一致
  • Comfort 在 H=21 上 回退 到 1.0416,Efficiency 1.0094 也略涨——长 horizon 把 trajectory 推向 GT,但 GT 本身可能不够 smooth,ADE/FDE 提升不等于 driving experience 提升
  • Total CCES:H=1 4.0000 → H=6 3.9396 → H=21 3.9524(H=21 回退

paper 的 honest 评价:long horizon 不带 CL/CLEF/TIS 是不够的,3.9524 的 Total 比 H=6 的 3.9396 还差。这条对复现者有具体警示价值——只把 H 拉长不带配套训练设计,可能反而比短 horizon 更差

7.3 Production-scale headline (Table 3, 1024 GPUs)

MetricBaselineX-Foresight改善
Lat ADE0.16750.1567-6.4%
Long ADE1.13871.0982-3.6%
Lat FDE0.41530.3789-8.8%
Long FDE2.91172.7924-4.1%
Collision0.228%0.191%-16.2%
Compliance0.94830.8708-8.2%
Safety0.94410.8583-9.1%
Total CCES3.82963.6535-4.6%

gain 集中在 Safety 和 Compliance,跟 chunk-wise + TIS 的设计意图严格对齐。Comfort 改善 1.0%、Efficiency 改善 0.4%——非 safety 维度的小幅顺带提升。

7.4 Renderer 6 秒 rollout 数字 (Table 5)

模块1s FID6s FID1s FVD6s FVD
Camera Latent Decoder10.9711.82135.56158.39
Vision Renderer1.512.8411.2829.52

Renderer 6 秒 vs 1 秒的 FID 涨幅 1.33、FVD 涨幅 18.24——“limited drift across the full prediction window”。Camera Latent Decoder 的绝对数字差很多(1.51 vs 10.97),但它的角色就是诊断、不是产出——糊得诚实是设计意图。

八、横向定位与跟前作的咬合

把 X-Foresight 摆到现在这一波 world model 工作里看,能看清几条 delta。

8.1 跟 X-World:从独立 simulator 到 LDM 内化

X-World 是 standalone generative simulator——可以独立做闭环仿真、数据生成、RL 后训练 rollout。X-Foresight 把 X-World 的 DiT + 3D causal VAE 收编进 renderer,但 imagination 的源头变成了 LDM 的 latent token。世界模型的"大脑"从 X-World 主网搬到了 LDM 主干里,X-World 退到 renderer 的位置只负责 photorealism。这是个范式转移——从"世界模型当外部数据生成器"到"世界模型当 VLA 主干的 latent imagination 模块"。

paper §6 conclusion 里写的 “a foundation for several future research directions” 第一条就是 “incorporating additional supervision during closed-loop rollout might further improve long-tail performance”——LDM 已经准备好接收来自 renderer 的 closed-loop pixel 信号反向回流。这是 X-World + X-Foresight 二元结构的下一步。

8.2 跟 X-Cache:训练设计本身就 inference-friendly

X-Cache 解决的是 standalone X-World 的推理 wall-clock。X-Foresight 走了不同路径——chunk-wise 一次 forward pass 输出 1 秒 tokens (4 帧 × 7 cams),BSA 让 attention cost 线性而非 quadratic 增长。这两条让 X-Foresight 训练设计本身就天然 inference-friendly——4Hz cadence 跟 action policy 输出对齐,每步 LDM 输出对应固定 chunk 量,renderer 一一对应渲染。X-Cache 那一套 cross-chunk residual cache 仍然可以叠到 renderer 这一侧(renderer 是 X-World fork,cache 协议复用),但 LDM 那一侧的吞吐已经被 chunk + BSA 吃掉一大半。

8.3 跟 dense-latent post:补齐 spatial × temporal 两个维度

Dense Latent Predictive Supervision 那篇抓的是在哪监督——latent 比 pixel 好,因为 capacity 不浪费、推理 cost 低、跟评测同构。X-Foresight 抓的是什么节奏监督——chunk-wise 在密集与稀疏间架桥、TIS 把预算压到 safety-critical。两者咬合得很干净:

维度dense-latent postX-Foresight
空间 / 时间spatial 维度的"在哪监督"temporal 维度的"什么节奏监督"
解决的浪费pixel 监督让 backbone 学 textureuniform sampler 让训练吃在 cruise segment
监督形式latent feature L2 / cosinecamera token L2 + chunk-wise AR + TIS
实证锚点Drive-JEPA NAVSIM 93.3X-Foresight Coll -16.2%

放到一起就是密集 + 长程 + 选择性的完整监督范式——latent supervision (空间维度密集 + 容量友好) × chunk-wise organization (时间维度密集 + 长程兼顾) × TIS (按 importance 选样本)。这三件单独看都是行业里有人做过的,捏在同一个 architecture 里训出来的工业级数字是 X-Foresight 的工程成绩。

8.4 三种 world model 范式坐标里的位置

paper §1 自己摆开了三种:

  • video-based generative(Sora / Genie / X-World)——pixel space 直接 model
  • 3D-centric(World Labs Marble)——显式几何
  • latent-based predictiveV-JEPA)——绕开 pixel space

X-Foresight 是 hybrid:latent space 里做 world knowledge(LDM 主干 + camera token + BEV),pixel space 留独立模块做 closed-loop feedback(renderer)。这跟 V-JEPA 纯 latent 路线 + 跟 Sora 纯 pixel 路线分别各取一半。两者职责严格分离——LDM 不背 pixel detail,renderer 不背 world structure。

九、几条保留的怀疑

(1) 280k 小时 / 13.8T tokens 是 industrial scale,公开复现极其困难。Paper 没给 mid-scale (1k-10k 小时档) 对照数据——这套 chunk-wise + curriculum + TIS 设计在小数据上能不能立得住,是开放问题。13.8T tokens 在驾驶领域是头部车企才能凑齐的量级,学术研究方法学层面值得参考,但具体 hyperparameter(chunk 长度 K=4、stride 1s→3s、TIS λ_x/λ_y/τ)的数值能不能直接搬到中等规模数据上没验证。

(2) Table 1 H=21 vs H=6 Total CCES 回退 (3.9524 vs 3.9396)。论文自己写得诚实——长 horizon 不带 CL/CLEF/TIS 配套时,可能比短 horizon 还差。这意味着复现者如果只把 H 拉长就期待收益,会踩坑。X-Foresight 的真正收益是 组合 出来的,不是单一组件就能复现的。

(3) Comfort 在长 horizon 上的回退。H=21 vs H=1 上 Comfort ratio 1.0416(变差)。ADE/FDE 改善 ≠ Comfort 改善——把 trajectory 推向 GT 同时也把 GT 本身的 jerkiness 学进来了。这条对评测维度选择有提示——single-metric optimization 在 driving 上很容易顾此失彼

(4) Renderer 12 秒 + 的 drift 数字缺位。Table 5 只给到 6 秒 (FID 1.51 → 2.84)。RL post-training rollout 通常需要 10-30 秒——12 秒之后 drift 是不是仍然 bounded、还是有 inflection point 突然爆,paper 没给。Conclusion 里第一条 future work “additional supervision during closed-loop rollout” 大概率正是为了解决这条。

(5) Camera Latent Decoder 的 audit 是间接证据。renderer 跟 latent decoder 输出几何一致只能说"两个 decoder 看到的 latent 结构吻合"——latent 本身在不在 ground truth 附近、long-tail 上是不是健康,audit 路径回答不了。这是这套工具集合的边界,不是缺陷,但需要在工程使用时记住。

(6) 没有跟"world model + VLA 解耦训练"范式的直接 head-to-head。X-Foresight 默认 joint training > decoupled (world model 单独训完再当 supervisor 喂 VLA)。但 paper 没列 ablation 直接对比这两种范式——比如冻住 LDM 只用它当 future supervisor、对比联合训练,差多少。这条对比缺失,让"必须 joint" 这个论点缺了一组关键证据。

(7) action prediction 在 immediate next step、observation prediction 在 strided chunk 的非对称设计。这条设计很关键,但 paper 没给单独 ablation 验证它必要性——如果 action 也跟着 stride 输出(比如每 3 秒预测一个轨迹片段),会差多少?是个值得跟进的开放问题。

十、相关阅读

X-Foresight 跟以下文章构成互补论证链:

References