← 返回

下游验证:GT 热图对 π0.5 的有用性

主线问题:我们标注的逐帧焦点热图交给下游操作模型 π0.5,能否降低动作预测误差或提高任务成功率。共六轮实验(R1–R6),分四节呈现。全部轮次的底座 = 2025 BEHAVIOR 挑战赛冠军的 50 任务预训练 π0.5 检查点。

六轮实验一览

轮节任务热图怎么用训练(数据 / 步数)可训参数评测结果与解读
R1一radio
(开收音机)
作为输入注入
(token 相加)
radio 183 集演示;LoRA 微调,10000 步跑程的 6000 步中期存档动作专家列 LoRA + 动作头 4 投影 + 注入模块(约 1%);视觉/语言骨干冻结开环差异 ±4% 内、方向混合 → 无信号
R2一radio作为输入注入
(token 相加 / 第 4 通道)
同上,10000 步终版同上开环16 格全部 ±3.7% 内 → 无信号,触发预先声明的止损
R3二radio注入臂喂 oracle 完美热图(仿真器逐帧现算 GT)不训练:R2 训好的权重原封不动—闭环
10 实例
基线 1/10,注入+oracle 0/10 → 完美热图也无成功率提升
R4二radio三种更强注入逼模型依赖热图(遮挡训练 / 轮廓叠加 / 聚光调制)radio 183 集补训:遮挡 2000 步、轮廓 2000 步、聚光 2000/6000 两档同 R1(轻量法)探针五种注入全部未使用热图的空间信息 → 判决:radio 上头部相机空间信息对模仿目标冗余
R5三task-0003
(收拾餐盘食物)
不作输入,改作训练期重建监督(测试期不需要热图)task-0003 182 集;基线 vs 加重建 × 2 种子,各全量微调 6000 步全部 3.3B(视觉+语言+动作列)+ 重建头;仅目标编码器 SD-VAE 冻结开环组间差落在两种子噪声带内 → 无信号
R6四task-0003同 R5,另补重建预训练阶段全语料 3450 集纯重建预训练 5000 步(动作损失置零)→ task-0003 微调 6000 步同 R5开环相对基线 +6%~+23% 显著全面变差 → 无动作锚定的纯重建预训练使骨干偏离动作任务

四节入口

第一节 · 热图作为输入注入(R1–R2)

radio · 开环。token 相加 / 第 4 通道两种注入 vs 基线,配对开环动作误差。

16 格差异全部 ±3.7% 内、方向混合 → 触发止损

进入 →

第二节 · 闭环验证 + 探针判决(R3–R4)

radio · 闭环 + 探针。官方协议 10 实例闭环(oracle 完美热图)· 五种注入的依赖探针 · 热图翻转误导探针 · rollout 视频。

基线 1/10 vs 注入+oracle 0/10;五种注入对热图零依赖 → 诊断为任务性质

进入 →

第三节 · 重建监督对照(R5)

task-0003 · 开环。热图只作训练监督(不作输入),2 模型 × 2 种子全量微调对照。

组间差未超出种子噪声 → 无信号

进入 →

第四节 · 重建预训练版(R6)

task-0003 · 开环。全语料纯重建预训练 → 微调,补齐 ReconVLA 原配方的预训练阶段。

相对基线 +6%~+23% 显著变差 → 方向明确的负结果

进入 →