主线问题:我们标注的逐帧焦点热图交给下游操作模型 π0.5,能否降低动作预测误差或提高任务成功率。共六轮实验(R1–R6),分四节呈现。全部轮次的底座 = 2025 BEHAVIOR 挑战赛冠军的 50 任务预训练 π0.5 检查点。
| 轮 | 节 | 任务 | 热图怎么用 | 训练(数据 / 步数) | 可训参数 | 评测 | 结果与解读 |
|---|---|---|---|---|---|---|---|
| R1 | 一 | radio (开收音机) | 作为输入注入 (token 相加) | radio 183 集演示;LoRA 微调,10000 步跑程的 6000 步中期存档 | 动作专家列 LoRA + 动作头 4 投影 + 注入模块(约 1%);视觉/语言骨干冻结 | 开环 | 差异 ±4% 内、方向混合 → 无信号 |
| R2 | 一 | radio | 作为输入注入 (token 相加 / 第 4 通道) | 同上,10000 步终版 | 同上 | 开环 | 16 格全部 ±3.7% 内 → 无信号,触发预先声明的止损 |
| R3 | 二 | radio | 注入臂喂 oracle 完美热图(仿真器逐帧现算 GT) | 不训练:R2 训好的权重原封不动 | — | 闭环 10 实例 | 基线 1/10,注入+oracle 0/10 → 完美热图也无成功率提升 |
| R4 | 二 | radio | 三种更强注入逼模型依赖热图(遮挡训练 / 轮廓叠加 / 聚光调制) | radio 183 集补训:遮挡 2000 步、轮廓 2000 步、聚光 2000/6000 两档 | 同 R1(轻量法) | 探针 | 五种注入全部未使用热图的空间信息 → 判决:radio 上头部相机空间信息对模仿目标冗余 |
| R5 | 三 | task-0003 (收拾餐盘食物) | 不作输入,改作训练期重建监督(测试期不需要热图) | task-0003 182 集;基线 vs 加重建 × 2 种子,各全量微调 6000 步 | 全部 3.3B(视觉+语言+动作列)+ 重建头;仅目标编码器 SD-VAE 冻结 | 开环 | 组间差落在两种子噪声带内 → 无信号 |
| R6 | 四 | task-0003 | 同 R5,另补重建预训练阶段 | 全语料 3450 集纯重建预训练 5000 步(动作损失置零)→ task-0003 微调 6000 步 | 同 R5 | 开环 | 相对基线 +6%~+23% 显著全面变差 → 无动作锚定的纯重建预训练使骨干偏离动作任务 |
radio · 开环。token 相加 / 第 4 通道两种注入 vs 基线,配对开环动作误差。
16 格差异全部 ±3.7% 内、方向混合 → 触发止损
进入 →radio · 闭环 + 探针。官方协议 10 实例闭环(oracle 完美热图)· 五种注入的依赖探针 · 热图翻转误导探针 · rollout 视频。
基线 1/10 vs 注入+oracle 0/10;五种注入对热图零依赖 → 诊断为任务性质
进入 →task-0003 · 开环。全语料纯重建预训练 → 微调,补齐 ReconVLA 原配方的预训练阶段。
相对基线 +6%~+23% 显著变差 → 方向明确的负结果
进入 →