← 返回目录
第四节 · 重建预训练版(task-0003,开环)
第三节的重建监督只在 6000 步微调里出现,而 ReconVLA 原配方还有一个前置阶段:先在大语料上做纯重建预训练,让骨干先学会"把注意力对准该操作的物体",再去学动作。本节补上这一阶段——用我们全部 3450 集标注语料做纯重建预训练,再到 task-0003 微调、同口径评测。
3450 集
预训练语料 = 全部标注语料(多任务)
首次分离
三轮 task-0003 对照中第一次出现明确组间分离——方向为变差
① 模型架构与训练流程(架构同第三节,多一个预训练阶段 → 画流程图)
网络结构与第三节完全相同(π0.5 全模型 🔥 + 重建头 🔥,SD-VAE ❄ 只编码监督目标)。不同点是训练分两阶段:
② 训练数据与步数
| 阶段 | 数据 | 步数 | 损失 |
| 预训练 | 全部 3450 集标注语料(BEHAVIOR-1K 多任务,含 radio 与 task-0003) | 5000 步 × batch 32 ≈ 16 万样本 | 只有重建(动作损失置零) |
| 微调 | task-0003 train 182 集(与第三节完全相同) | 6000 步 × batch 32 | 动作 + 重建 0.25 |
③ 可训与冻结参数
两个阶段都与第三节相同:可训 🔥 = π0.5 全模型 3.3B + 重建头;冻结 ❄ = SD-VAE 目标编码器。单种子(42)。
④ 评测方式
开环,与第三节完全同口径:15 留出集、同帧同噪声配对(n=15216)、按身体部位分组、subgoal 交接帧为主要终点。对照 = 第三节的基线两种子均值、加重建两种子均值。
⑤ 结果与结论
悬停可看精确数值。* = 95% 区间不含零。与前三轮"方向混合、区间跨零"完全不同:这里 16 格全部为正,12 格过显著线——一致地变差。
| 对照 | 层 | 底盘 | 躯干 | 双臂 | 夹爪 |
| 预训练版 − 基线均值 | subgoal 交接帧 | +12.22±2.47* | +23.40±6.64* | +1.53±1.83 | +13.10±20.00 |
| 其余帧 | +16.83±0.93* | +15.66±2.43* | +5.96±0.90* | +6.58±3.80* |
| 预训练版 − 无预训练加重建版 | subgoal 交接帧 | +15.23±2.71* | +19.30±6.64* | +1.20±1.83 | +10.43±20.66 |
| 其余帧 | +18.29±1.01* | +18.33±2.77* | +4.99±0.86* | +1.68±4.04 |
结论:加上纯重建预训练后显著全面变差(相对基线 +6%~+23%,也差于不带预训练的加重建版)。解读:预训练阶段动作损失置零,骨干在 16 万样本里只被"重建热区图块"牵引,表征偏离了动作任务,6000 步微调没能拉回来。边界:本档预训练量级只有原配方的 1/12,且预训练阶段完全没有动作锚定——加大量级或改"动作+重建"混合预训练能否翻转,未测。