• 正文
  • 相关推荐
申请入驻 产业图谱

从“预测未来“到“选择未来“:WAV 如何把价值函数装进 VLA 的推理闭环

08/05 09:06
170
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

转载自公众号:敢敢AUTOHUB

0. 简介

World–Value–Action确实回答了一个 VLA 路线里被回避了很久的问题——机器人是否应该在动作之前,先在脑子里把多个未来推演一遍,再用一把"价值尺"筛掉那些看起来能动、但不值得做的轨迹。这篇博客把论文的核心机制、关键代码段、横向对照和实验数字一次性铺开,让一个完全不了解 VLA 的读者,也能在二十分钟内抓到 WAV 的脉络确实回答了一个 VLA 路线里被回避了很久的问题——机器人是否应该在动作之前,先在脑子里把多个未来推演一遍,再用一把"价值尺"筛掉那些看起来能动、但不值得做的轨迹。这篇博客把论文的核心机制、关键代码段、横向对照和实验数字一次性铺开。

进一步看,WAV 把这条问题拆成了三件事:世界模型负责想象未来视频,价值模块负责给每一段未来打分,动作模块再把得分最高的未来反推成可执行的关节指令。这三件事第一次在一个统一的潜在空间里被串成闭环,并配上了 MPPI 风格的迭代采样过程。换句话说,WAV 不只是又一次堆参数,而是把强化学习里的"价值函数"和具身智能里的"世界模型"做了一次彻底的工程化对齐。

GitHub项目地址:https://github.com/Win-commit/WAV
项目主页:https://win-commit.github.io/wavpage/

1. 为什么又造了一个新名词

1.1 直接动作预测撞上的长时序天花板

具身智能这两年从 RT-1、RT-2、OpenVLA 一路打到 、,主流路线一直在做一件事:把视觉编码、语言编码、动作解码塞进一个端到端模型,每一步只解决"下一秒手腕往哪里走"这件小事。这条路线在桌面级抓取、单步移动上表现确实漂亮,但只要任务进入长时序复合操作,比如抽屉先开后关、毛巾先抓再展开,直接动作预测就开始出现一种典型的失败模式:每一步看起来都对,整条轨迹却一步步偏出可行域。直观理解是,模型只关心"下一步该做什么",从未问过"这一步会不会让接下来的几十步无路可走"。

进一步看,VLA 的失败并不只发生在最后一步。论文给出了一组很直接的数据:在 LIBERO Long 这种长时序套件上,传统 Diffusion Policy 成功率只有 50.5%,Octo 也只有 51.1%,即便是 7B 参数量的 OpenVLA 也只跑到 53.7%,远低于它们在短时序套件上的表现。这意味着模型规模并不能直接补偿"没有未来观"的结构缺陷。这里的关键是,真实任务的失败概率会沿着步数累乘,而短视策略缺乏在中途修正的机会。

1.2 世界模型补上想象力,但补不上判断力

为了让 VLA 看到更远的未来,过去两年涌现出大量 World Action Model(WAM)路线工作,代表性的有 WorldVLA、DreamVLA、FlowVLA、Genie Envisioner 等。这些方法把视频生成模型挂在 VLA 旁边,让模型"先想象一段视觉未来,再决定动作"。这条路线的核心贡献是引入了预测能力,让模型对场景的演变有一个内部模型。但 WAM 路线有一个隐藏前提:未来一旦被想象出来,就默认它是"好"的,模型并没有专门的模块去判断这段未来到底值不值得追求

核心问题在于,世界模型本身只回答"可能发生什么",不回答"哪种发生更可取"。一旦任务存在多种合理的未来分支(先开抽屉再放东西 vs 先放东西再开抽屉),WAM 路线就只能依赖动作头的隐式偏好来选择,缺乏一个显式的"长期收益"信号。这恰恰是强化学习里 V 函数解决的核心问题。WAV 的关键判断在于,把价值函数显式塞进世界模型的推理闭环,让"想象"和"评估"第一次在同一个潜在空间里联动

2. 整体框架:World、Value、Action 三模块的潜在空间合谋

2.1 输入输出与三模块的角色分工

WAV 在接口层和现有 VLA 没有太大差别:输入是多视角 RGB 观测 、语言指令 、机器人本体状态 ,输出是未来一段  步的动作 。真正的不同发生在中间:三个子模块在潜在空间里各司其职,又通过迭代采样紧紧耦合。这里的关键是,三模块不是简单的串行堆叠,而是共享同一个 DiT 主干,并通过 cross-attention 把视频特征、价值特征注入动作 token,下面这组前向公式可以一眼看出耦合方式:

其中  是第  层 DiT 块产生的视频 token, 是价值 token, 是动作 token 的中间状态。这里要厘清的是,动作 token 在每一层都会先和视频 token 做 cross-attention,再和价值 token 做 cross-attention,相当于动作生成过程中两次被"未来该长什么样"和"未来值多少分"反复校准。

2.2 训练与推理之间的关键不对称

WAV 在训练和推理时的角色分工是不同的,这一点常常被忽略。训练阶段采用 Flow Matching 三阶段策略:第一阶段只训练视频生成模块;第二阶段冻结视频模块、训练价值模块;第三阶段把全部模块联合训练。这种由粗到细的训练顺序,让世界模型先具备稳定的预测能力,再让价值模块在干净的视觉特征上学打分,最后让动作头利用前两者已稳定的输出。

直觉理解(为什么不端到端一锅炖):好比驾校先让你学油门刹车,再练倒车入库,最后才上路;如果一上来就要求"边开车边学认路边学礼让",模型很容易在多个目标之间互相打架。三阶段冻结其实是在防止价值信号污染世界模型的预测分布。

推理阶段则换了一种姿态:所有模块都被冻结,但模型不再只跑一遍 forward,而是用 MPPI 风格的迭代采样反复刷分。每一轮,模型采样  组视频潜变量、 组价值潜变量,计算 SNR 选出 top-、 精英样本,更新潜在噪声分布的均值方差。这种训练—推理的不对称设计,是 WAV 实现"隐式规划"的关键工程支点。

3. 第一条核心机制:在潜在空间里规划,而不是在动作空间里盲采

3.1 动作空间规划的"可行性指数衰减"

理解 WAV 为什么要在潜在空间里搜,必须先理解动作空间搜索的失败方式。论文里给出的引理 4.1 可以用一句话概括:当规划步长  增大时,可行轨迹在动作空间里所占的概率质量按  指数衰减。形式化地写,假设轨迹空间  的环境维度是 ,可行轨迹流形  的内蕴维度 ,则有:

难点提示(可行性指数衰减是怎么回事):直观理解就是想象你要在一张 1 米×1 米的纸上随机扔筷子,让它正好落到一条只有 1 毫米宽的曲线上。规划步长越长,这条曲线在整个高维空间里就越细,蒙到的概率自然指数级下降。这并不是"动作维度太高"这么浅的事情,而是物理可执行+任务语义对齐共同压缩出来的薄流形让蒙猜变得几乎不可能。

3.2 潜在采样的概率质量重整化

WAV 的解法是不再在动作空间里蒙猜,而是先学一个潜在生成器 ,把视频先验和任务语义编码进去,再从一个状态相关的潜在分布  里采样。论文里给出的命题 4.2 表明,当生成器能近似捕获可行流形时,潜在采样落在可行集里的概率会比动作空间均匀采样高出指数级倍数:

这意味着潜在采样并不是"减少维度"这么简单的事情,而是把整个搜索分布的概率质量重新搬运到物理可行、语义对齐的那一小块区域上。换句话说,模型在生成阶段就已经把绝大多数"根本不可能成功"的轨迹排除在采样之外,剩下的迭代优化只需要在这块已经被筛过一遍的可行区域里做精细化,搜索难度因此从指数级降到可控范围。

3.3 代码透视:视频特征是怎样被生成的

下面这段简化的伪代码对应仓库里语言条件视频生成模块的核心 forward 流程(来源:models/video_dit.py,配合论文 §4.2 的语言条件视频生成模块描述)。这段代码的关键是 cross_attn 把 T5 编码后的语言 embedding 和多视角视觉 token 拼接进 DiT 主干,让语言指令能直接影响视频生成的每一层变换。

# models/video_dit.py(简化版)
def forward(self, v_init, v_memory, z_noise, lang_emb, view_idx):
    """
    v_init   : 多视角初始观测特征 list[Tensor(B, L_v, d)]
    v_memory : 稀疏视觉记忆 list[Tensor(B, L_m, d)]
    z_noise  : view-specific 高斯潜变量 list[Tensor(B, L_z, d)]
    lang_emb : T5-XXL 语言 embedding Tensor(B, L_g, d_t)
    """
    tokens = []
    for i in view_idx:                                 # 头/左/右相机
        x = torch.cat([v_init[i], v_memory[i], z_noise[i]], dim=1)
        tokens.append(x)
    x = torch.cat(tokens, dim=1)                       # 多视角拼接
    for block in self.dit_blocks:
        x = block.self_attn(x)                         # 时空自注意力
        x = block.cross_attn(x, lang_emb)              # 注入语言意图
        x = block.ffn(x)
    x_future = self.video_decoder(x)                   # 自回归出未来 N 帧
    return x_future

这里要厘清的是,这段代码并不是简单的视频扩散,而是一个语言条件的潜变量推断器:噪声  的分布在推理时是会被迭代更新的,初始的高斯只在第 0 轮成立,后续会被价值评估反推回去重塑均值与方差。这一点是 WAV 与 DreamVLA、FlowVLA 等纯生成式世界模型的本质区别。

4. 第二条核心机制:轨迹价值函数把强化学习塞进了 VLA

4.1 价值函数评估的是"整段未来"

WAV 的轨迹价值模块并不像传统 Critic 那样只评估单个状态,而是评估一段未来视觉轨迹的累计折扣回报,把从当前时刻到未来 H 步的所有奖励一次性聚合起来,这样才能反映出"整段轨迹是否真的值得执行"而不仅仅是"下一步看起来好不好"。形式化地写,目标值是:

其中  是折扣因子, 是密集奖励函数。论文沿用了 ReinboT 的密集奖励设计,把奖励分成四类:子目标完成、任务进度、行为平滑度、任务终止状态。具体到双臂场景里展开成 9 个奖励项、16 个标量分量,分别对应 wrist-view MSE、wrist-view SSIM、top-view MSE、top-view SSIM、关节状态接近度、关节速度惩罚、关节加速度惩罚、动作速度惩罚、动作加速度惩罚,每项权重经过精细调参以避免行为僵硬。

工程价值(密集奖励为什么重要):稀疏奖励在长时序任务里几乎等同于没有奖励,价值函数学不到任何梯度信号。密集奖励把"整段轨迹好不好"分解到每一步上,让 V 函数在训练时能感知到"开抽屉过程中机械臂动作是否平滑"这种细粒度信号。

4.2 信噪比 SNR 作为打分稳定器

WAV 的一个工程小技巧是用 SNR 而不是直接用均值评分,让评估结果既考虑分数本身的高低又考虑模型对这个分数有多确信,从而在多次采样中自动过滤掉那些方差过大的不稳定预测,避免模型在某些容易过拟合的潜变量区域产生误导性高分。给定第  个视频探索、第  个价值探索的预测,SNR 定义为:

最终第  个视频探索的得分取所有价值探索中最可信的那次:。这里的关键是,SNR 自带置信度过滤:方差大的预测会被自动压低分数,避免模型对一段"看起来很好但其实模型自己也吃不准"的未来过度自信,从而让 top-K 精英筛选挑出的都是"高分且稳定"的轨迹。

4.3 代码透视:价值模块的注入路径

价值模块在工程上的实现非常优雅,它复用了 DiT 主干,只是初始化一个独立的 value token,并通过 cross-attention 与视频特征对齐,让价值评估能同时看到"未来视频长什么样"和"任务要求是什么",从而在统一的表征空间里完成从视觉到价值的映射。下面这段是简化后的核心 forward(来源:models/value_head.py,对应论文 §4.2 trajectory value module):

# models/value_head.py(简化版)
class TrajectoryValueModule(nn.Module):
    def __init__(self, d_model, n_blocks):
        super().__init__()
        self.z_val = nn.Parameter(torch.randn(1, 1, d_model))   # 可学习初始 value token
        self.blocks = nn.ModuleList([
            DiTValueBlock(d_model) for _ in range(n_blocks)
        ])
        self.head = nn.Linear(d_model, 1)                       # 回归累计折扣奖励

    def forward(self, x_video, lang_emb, z_noise):
        u = self.z_val.expand(x_video.size(0), -1, -1) + z_noise
        for block in self.blocks:
            u = block.cross_attn(u, x_video)                    # 看视频特征
            u = block.cross_attn(u, lang_emb)                   # 看语言意图
            u = block.ffn(u)
        return self.head(u).squeeze(-1)                         # (B,) 单标量

进一步看,这里要厘清的是 z_noise 不是固定的标准高斯,而是会随着 MPPI 迭代被更新的分布样本。也就是说,价值模块本身是一个条件流匹配模型,给定 (x_video, lang_emb) 和当前的 z_noise,它会输出一个累计奖励估计;模型在推理时反复打分,再把得分高的样本对应的 z_noise 收集起来更新分布。这种"评分—回流—再评分"的反馈,是把价值函数嵌进推理闭环的关键工程支点。

5. 训练时的监督模块:三阶段流匹配让模型各司其职

5.1 三阶段冻结策略

WAV 的训练流程被拆成三个阶段,每个阶段冻结上游模块,让下游模块在稳定的输入分布上学习,避免多个目标之间互相干扰梯度。第一阶段只训练视频生成模块,目标是让模型先学会"给定指令和初始观测,能生成什么样的未来视频",损失函数是经典的视频流匹配 MSE:

第二阶段冻结视频模块,只训练价值模块。此时价值模块面对的视频特征是稳定的,能专心学习给定视频如何预测累计奖励这件事,不必同时操心视频生成质量是否在退化,整个训练过程因此变成一个干净的回归问题,价值模块只需要学一个从视觉特征到标量回报的映射函数,损失函数因此对称地写成:

第三阶段才是动作头联合训练,此时前两个模块已经各自学到稳定的表征,动作头可以直接利用它们的输出而不用担心输入分布剧烈漂移,整个 pipeline 在这一阶段才真正变成端到端可微的,并且最终的动作预测损失能够通过较小的权重把梯度回传到上游模块做精细化对齐,这种渐进式联合训练在大模型工程里非常常见:

解读(为什么不端到端一锅炖):如果三阶段同时训练,价值的梯度会顺着 cross-attention 回流到视频模块,让视频生成器倾向于"生成容易被高分评估"的视频而不是"真实可能发生"的视频。这种被价值污染过的世界模型在分布外场景上极易崩溃。冻结策略本质是在做信号隔离,让每个模块只看自己该学的那部分。

5.2 训练资源与超参数

工程上,WAV 在 8 张 NVIDIA A100-80GB 上进行训练。视频阶段用 30000~40000 个 step、batch size 128、学习率 、weight decay ,caption dropout 0.06。价值与动作阶段沿用 batch size 128,但学习率降到 ,caption dropout 设为 0。优化器统一是 Adam,。这里的关键是,学习率梯度从视频阶段的  降到价值/动作阶段的 ,是为了避免后期对已稳定的视频特征产生剧烈干扰,让整个三阶段训练过程保持稳定收敛而不出现后期崩盘。

整个 LIBERO 任务的训练大概要 5 天时间才能跑完三阶段,真实 Piper 双臂任务每个任务要训练 3 天。模型大小 2.2B 参数量,比 OpenVLA 的 7B、 的 3B 都小,但成绩反而更好——这一点在第 9 节会用 LIBERO 上的对照实验数据进一步展开,说明模型规模不再是 VLA 性能的唯一决定因素,结构创新与训练范式同样关键。

6. 推理时的执行模块:MPPI 在潜在空间里的实例化

6.1 想象—评分—更新的三步闭环

WAV 的推理过程是它最像 Model Predictive Path Integral(MPPI)的地方。每一次推理实际上是一个外循环  次的迭代过程:第  轮先从当前分布  采样  个视频潜变量,每个潜变量经过  解码得到一段视频特征;对每段视频特征再采样  个价值潜变量,用  跑出 SNR 分数;最后挑出 top- 视频精英、top- 价值精英,更新两个高斯分布的均值和方差。

数学上,视频分布的更新规则是把本轮选出的精英潜变量的经验均值和经验标准差,作为下一轮采样高斯分布的新参数,从而把概率质量逐轮搬运到当前已知最好的潜在区域,具体写成如下两个式子,其中  是 top- 精英视频样本的下标集合,求和则在这个精英集合上进行:

价值分布的更新规则形式相同,只是聚合范围变成所有  个评估里取 top-。这里的关键是,迭代不是"随机扰动试错",而是严格的精英采样—分布重构闭环,让模型在每一轮都把概率质量往"已经被高分轨迹占据的区域"集中,从而把搜索从盲目探索转换成有向收敛。

6.2 分布平滑与方差衰减

直接按精英样本统计更新分布会有一个隐患:如果某轮采样不幸都落在一个糟糕的局部区域,分布会立刻收缩到错误位置,后续轮次很难再跳出来,模型会陷入早熟收敛。WAV 用一组指数平滑参数  来缓解这个问题,让新旧分布以滑动平均的方式融合,给收敛过程留出回旋余地:

难点提示(指数平滑在干什么):可以把它类比成股票市场里的均线指标——你不是用今天的 K 线立刻全仓押下一步,而是用 5 日均线、20 日均线慢慢移动。 大代表更相信本轮新样本,小则代表更稳健地继承历史分布。论文的消融实验显示当  太小时成功率会断崖式下降,这印证了过强平滑会让模型陷入早期分布的局部最优。

6.3 代码透视:MPPI 主循环

下面这段对应仓库里推理时的核心调度逻辑(来源:inference/wav_planner.py,对应论文 Algorithm 1),展示了视频潜变量和价值潜变量如何在外循环 K 轮中交替采样、评分、筛选、回流。每一轮的关键是把上轮选出的精英样本作为下轮分布的中心,从而让搜索过程像剥洋葱一样逐层收敛到高价值区域。

# inference/wav_planner.py(简化版)
def wav_plan(obs, lang_emb, world, value, action_head,
             K=3, M=8, N=4, K1=3, K2=8, alpha=0.7, beta=0.5):
    mu_v, sig_v = torch.zeros(d_z), torch.ones(d_z)     # video 潜变量分布
    mu_u, sig_u = torch.zeros(d_z), torch.ones(d_z)     # value 潜变量分布

    for k in range(K):
        z_vid = mu_v + sig_v * torch.randn(M, d_z)
        x_fut = world(obs, lang_emb, z_vid)             # M 段未来视频特征

        z_val = mu_u + sig_u * torch.randn(M, N, d_z)
        v_pred = value(x_fut.unsqueeze(1).expand(-1, N, -1, -1),
                        lang_emb, z_val)                # M × N 价值预测
        snr = v_pred.mean(-1) / (v_pred.std(-1) + 1e-6) # (M, N)
        score = snr.max(dim=-1).values                  # 每段 video 的最优 SNR

        elite_v = z_vid[score.topk(K1).indices]
        elite_u = z_val.flatten(0, 1)[snr.flatten().topk(K2).indices]

        mu_v = alpha * elite_v.mean(0) + (1 - alpha) * mu_v
        sig_v = beta * elite_v.std(0) + (1 - beta) * sig_v
        mu_u = alpha * elite_u.mean(0) + (1 - alpha) * mu_u
        sig_u = beta * elite_u.std(0) + (1 - beta) * sig_u

    z_vid_star = mu_v + sig_v * torch.randn(1, d_z)
    z_val_star = mu_u + sig_u * torch.randn(1, d_z)
    return action_head(obs, lang_emb, z_vid_star, z_val_star)

进一步看,这段代码也回答了一个常见疑问:MPPI 迭代会不会让推理变得无法实时?论文给出的答案是:当  时性能与速度达到最佳折中,继续增加  收益迅速递减。这一点在第 9 节的消融图里有清晰的体现,说明 WAV 的推理开销是可控的,不会因为引入迭代规划而让部署成本爆炸。

7. 训练目标的全貌:三个损失与一个奖励家族

7.1 三阶段流匹配损失的串联

把上面提到的三个损失合在一起,WAV 的总训练目标可以写成阶段性的串联:第一阶段只优化 ,第二阶段在冻结视频模块的前提下优化 ,第三阶段把全部模块联合训练,但仍以  为主、其它两个作为辅助监督。形式化地写:

其中  是经验权重,作用是防止动作头"吃光"视频和价值模块的容量。这种渐进式损失装配在大模型工程里非常常见,但 WAV 的特别之处是在第三阶段仍然保留视频与价值的监督——没有这层兜底,价值模块会随动作头一起漂移,导致推理时打分失真。下面这段代码对应仓库里第三阶段联合训练的损失装配逻辑(来源:train/stage3_joint.py,对应论文 §4.2 flow matching 训练):

# train/stage3_joint.py(简化版)
def joint_loss(model, batch, lam1=0.5, lam2=0.5):
    t = torch.rand(batch.size, device=batch.device)        # 流匹配时间步
    # 视频流匹配:预测 x1 - x0
    v_vid = model.video(t, batch.lang, batch.obs, batch.x_t)
    L_vid = ((v_vid - (batch.x1 - batch.x0)) ** 2).mean()
    # 价值流匹配:预测 v1 - v0(v1 是累计折扣回报)
    v_val = model.value(t, batch.lang, batch.obs, batch.z_vid, batch.v_t)
    L_val = ((v_val - (batch.v1 - batch.v0)) ** 2).mean()
    # 动作流匹配:预测 a1 - a0
    v_act = model.action(t, batch.lang, batch.obs,
                          batch.z_vid, batch.z_val, batch.a_t)
    L_act = ((v_act - (batch.a1 - batch.a0)) ** 2).mean()
    return L_act + lam1 * L_val + lam2 * L_vid             # 动作为主,其余兜底

这段代码的关键是 L_act 作为主损失、L_val 和 L_vid 作为辅助监督同时反传,权重  默认设为 0.5。这里要厘清的是,第三阶段并没有把视频和价值模块完全冻死,而是用较小的权重让它们继续微调,从而在动作生成的目标下保持三个模块的协同一致性,避免上游模块因为完全静态而和下游动作头产生分布漂移。

7.2 密集奖励家族的工程细节

价值模块需要密集奖励作为监督信号,否则稀疏的任务完成标量无法为长时序轨迹的每一步提供有效梯度。WAV 沿用了 ReinboT 的奖励设计,但去掉了子目标完成项,留下了 9 个奖励项 / 16 个标量分量,覆盖四个维度:视觉相似度(MSE/SSIM)、运动学接近度、关节平滑度、动作平滑度。视觉相似度这部分使用:

其中  是当前帧、 是任务末帧、 表示左右臂腕部相机。这里的关键是,奖励直接挂钩"距离终态的相似度",让 V 函数自动学到一种"倒推距离"——离任务终态越接近,分数越高。这种设计对长时序任务尤其友好,因为它能让 V 在中段提供稳定梯度,而不是只在终点给一个稀疏脉冲。

7.3 公式背后的工程哲学

把所有公式拼在一起,WAV 真正在做的事情是把强化学习里的 V 函数和具身智能里的世界模型用流匹配统一起来。本质上是一个用 RL 价值监督流匹配模型,再用流匹配模型在潜在空间里做 MPC 规划的三层叠加。这种叠加并不新鲜,但 WAV 是第一个把它在 VLA 场景里端到端跑通的工作。

8. 蒸馏与加速:当 K=3 是性价比拐点

8.1 推理迭代轮数的性能曲线

WAV 的论文给出了一张关键的性价比曲线:在 LIBERO 上,从 (不迭代)到 ,成功率显著提升;从  到 ,成功率提升幅度迅速递减。这条曲线说明 MPPI 风格的迭代有一个显著的性价比拐点,超过这个拐点继续增加迭代轮数只会加大推理延时,不会带来同比例的性能提升。

工程价值(K=3 这条线意味着什么):实战部署时,机器人必须在 100~200ms 内出动作,否则会丢帧。 这个拐点意味着 WAV 可以选择一个固定的迭代轮数作为部署默认值,而不必担心"多迭代几轮会不会更好"的二阶取舍。

8.2 GPU 显存与推理时间

论文进一步给出了显存和时间的实测数字。在 NVIDIA A100 上, 时单次推理大约比 baseline GE-ACT 多消耗一倍的时间,但显存增加幅度较小。这是因为  个样本在前向时可以批量化处理,能复用大部分中间激活,但显存的开销主要发生在中间激活的累积,随  线性增长而非指数增长。

8.3 与蒸馏路线的关系

WAV 目前没有显式做蒸馏,但论文在 Conclusion 里点了一句"real-time closed-loop deployment is a future direction"。这里要厘清的是,WAV 的 MPPI 推理结构非常适合做单步蒸馏——把  时收敛的潜在分布作为软标签,去监督一个单步推理的学生模型。这条路线已经在 Diffusion Policy 系列里被验证过,迁移到 WAV 应该只是工程量问题。

9. 总结

WAV 第一次把强化学习里的"价值函数"和具身智能里的"世界模型"在同一个潜在空间里完整对齐,让 VLA 从"预测下一步动作"跨越到"在多个可能未来里挑一个最值得追求的"——这是 VLA 路线从动作预测走向价值驱动决策的关键一步。

相关推荐