← 返回目录

第三节 · 热图作为重建监督(task-0003,开环)

radio 的判决(第二节)说明输入侧注入在该任务上没有梯度压力。本节换两个东西:任务换成需要视觉消歧的 task-0003;热图不再作输入,改作训练期的重建监督信号(ReconVLA 思路)——测试期完全不需要热图。问题变为:这份监督能否让骨干把注意力聚到该操作的物体上,从而降低动作误差。

2×2
基线 / 加重建 × 两种子,唯一差别 = 重建损失
15216
配对样本(15 留出集)
灰带内
组间差 ±0.3–4.8%,种子噪声 ±0.1–10.8%:未超出噪声
无信号
单格方向在两种子间会翻转

① 模型架构(加了重建头 + 转全量微调 → 画架构图)

训练期 三路相机 224² + 状态 23 维 + 任务文本 (无热图输入) π0.5 全模型 3.3B 🔥 SigLIP + Gemma + 动作专家列 全部可训(全量微调) 动作损失(流匹配) 头部相机 256 token(最后一层) 重建头 🔥(约 8M) 2 层 cross-attn + 流匹配去噪 重建损失 权重 0.25 监督目标:热区图块 latent 由 GT 热图离线构造(见下条) 关键点:热图只出现在损失的目标一侧,从不进模型输入 —— 测试期天然不需要热图。 测试期 三路相机+状态 +任务文本 π0.5 全模型 (训练后权重) 动作 重建头训练结束即丢弃 不需要热图、无额外推理开销

与第一、二节(轻量法)的两个不同:改全量微调(重建损失的梯度要能改到视觉骨干才有意义);热图从输入侧挪到监督侧。

重建目标怎么构造(训练管线实际消费的真实数据)

头部相机 RGB
×
GT 热图(0–1)
=
逐像素调制
→
热区包围框抠出 → 224²
→
冻结 SD-VAE ❄ 编码 → latent 4×28×28(四通道)

task-0003 训练集 episode_00030040 第 2850 帧:机器人正把餐盘放进冰箱,热图压在放置目的地与盘缘。四联全部由训练脚本同款数学从原始数据渲出,latent 直接读自训练消费的预编码文件。

② 训练数据与步数

项值
任务BEHAVIOR-1K cleaning_up_plates_and_food(task-0003,收拾餐盘食物:把餐盘、食物从桌面收进冰箱/置物架)
为什么换它不同 demo 收拾的对象与去处不同 → 光靠关节状态记不住"这次该拿哪个",视觉消歧成为拟合必需(radio 恰好相反)
数据200 集官方演示:train 182 / test 15(切分种子 3)/ 3 集无 GT 排除
训练2 模型(基线 / 加重建,唯一差别 = 重建损失 0.25)× 2 种子(42/43),各全量微调 6000 步,batch 32

“不同 demo 收不同对象”长什么样(真实训练帧 + GT 热图叠加)

episode_00030020:桌上两盘披萨待收,焦点压在置物架(去处)
episode_00030040:夹爪已端起餐盘,焦点在盘与冰箱格
episode_00030030:披萨已进冰箱,焦点在冰箱内目标位

三集在同一场景但收拾对象、顺序、去处各不相同——模型必须看画面才能知道当下该操作什么。

③ 可训与冻结参数

组件规模
可训 🔥π0.5 全模型(SigLIP 视觉 + Gemma 语言 + 动作专家列)+ 重建头(训练结束丢弃)3.3B + 约 8M
冻结 ❄SD-VAE(只用来把监督目标编码成 latent,不在模型里)84M

架构图中已标 🔥/❄。基线与加重建两组的可训范围完全相同,唯一差别是损失里多一项重建损失。

④ 评测方式

开环,与第一节同口径:15 留出集逐帧预测 32 步动作块,与真值逐维 L1、按身体部位分组;基线与加重建看同帧同噪声(配对,n=15216);主要终点 = subgoal 交接帧。测试期不提供热图(本方法测试期本来就不需要)。

⑤ 结果与结论

开环配对差 Δ%(加重建 − 基线,负 = 加重建误差更小)task-0003 · 两种子交叉平均 · 15216 配对样本 · 横线 = 95% 置信区间加重建 − 基线(两种子均值)-12%-8%-4%0%+4%+8%+12%subgoal 交接帧主要终点 · n=1763subgoal 交接帧 底盘 种子噪声带 ±2.3%底盘subgoal 交接帧 底盘: -2.61% ± 1.31-2.6*subgoal 交接帧 躯干 种子噪声带 ±10.8%躯干subgoal 交接帧 躯干: +3.44% ± 4.65+3.4subgoal 交接帧 双臂 种子噪声带 ±6.9%双臂subgoal 交接帧 双臂: +0.32% ± 1.04+0.3subgoal 交接帧 夹爪 种子噪声带 ±9.6%夹爪subgoal 交接帧 夹爪: +2.42% ± 7.43+2.4其余帧sanity · n=13453其余帧 底盘 种子噪声带 ±1.9%底盘其余帧 底盘: -1.24% ± 0.42-1.2*其余帧 躯干 种子噪声带 ±5.7%躯干其余帧 躯干: -2.25% ± 1.66-2.2*其余帧 双臂 种子噪声带 ±1.5%双臂其余帧 双臂: +0.92% ± 0.42+0.9*其余帧 夹爪 种子噪声带 ±8.6%夹爪其余帧 夹爪: +4.81% ± 3.12+4.8*灰带 = 同方法两种子间的配对差量级(种子噪声);数据点落在灰带内 = 组间差不超过噪声

悬停可看精确数值。* = 95% 区间不含零。判读要点:把每格数据点与它背后的灰色噪声带比——8 格全部落在噪声带内或边缘,且过显著线的格子方向混合(底盘变好、双臂夹爪变差)。

种子噪声尺(判定"无信号"的依据)
对层底盘躯干双臂夹爪
基线 种子2−种子1subgoal 交接帧−2.33±2.27−10.81±6.46+6.94±2.25+9.62±4.33
加重建 种子2−种子1subgoal 交接帧+1.87±2.08−2.19±7.04+4.35±2.04+4.96±14.91
基线 种子2−种子1其余帧−1.88±0.75−5.71±2.42+0.11±0.89−8.58±4.88
加重建 种子2−种子1其余帧+0.78±0.71−0.84±2.53−1.52±0.93−0.68±4.91

同一方法只换随机种子,差异就有 ±0.1–10.8%;组间差(±0.3–4.8%)没有超出这个量级。单格例子:底盘交接帧在种子 1 上 −4.64*,在种子 2 上只有 −0.53;躯干在种子 2 上 +8.49*,种子 1 上 −1.07——方向都会翻。

结论:重建监督版与基线的组间差落在种子噪声之内,方向混合、跨种子不稳——无信号(既没有变好,也没有变坏)。ReconVLA 原配方还有一个本轮缺失的成分:大规模重建预训练。第四节补上它。