问题:把逐帧 GT 热图作为额外输入喂给 π0.5,动作预测误差降不降。两种注入方式(B1 token 相加 / B2 第 4 通道)vs 基线 A,同帧同噪声配对比较。
图 1 · 架构与两个注入点。蓝=冻结,橙=可训练;B1 在视觉编码器出口对头部相机 token 逐位置相加,B2 在最入口作第 4 通道。缩略图为真实数据。两者零初始化,第 0 步与基线逐比特相同。
| 项 | 值 |
|---|---|
| 任务 | BEHAVIOR-1K turning_on_radio(task-0025,开收音机:走到咖啡桌前,抓起收音机并开启);官方遥操演示数据 |
| 数据 | 183 集演示训练 / 16 集留出评测(不参与训练) |
| 步数 | 同一跑程两个存档:R1 = 6000 步中期档,R2 = 10000 步终版;batch 32,LoRA 微调 |
| 热图 | 人工审核过的 GT 标注(非预测器输出):10Hz 标注逐语义区域插值到 30Hz,224×224 最大池化保峰值,取值 0–1 |
| 对照设计 | 三个模型同数据同步数:基线 A(不加热图)/ B1(token 相加注入)/ B2(第 4 通道注入),唯一差别 = 是否注入热图 |
| 项 | 值 |
|---|---|
| 载体 | π0.5(openpi behavior 分支):三路相机 224×224 + 23 维状态 + 任务文本 → 32 步动作块(23 维/步,流匹配) |
| 底座 | 2025 BEHAVIOR 挑战赛冠军的 50 任务预训练检查点。不用通用底座(动作误差里全是底座噪声),也不用官方 radio 单任务检查点(其本身即基线,无从对照) |
| 任务 / 数据 | turning_on_radio;183 集训练 / 16 集留出评测 |
| 训练 | LoRA 微调 10000 步,batch 32;可训 = 动作列 LoRA + 动作头投影 + 注入模块 |
| 热图口径 | 标注 10Hz → 逐语义区域插值到 30Hz;224×224 最大池化保峰值;取值 0–1 |
| 组件 | 规模 | |
|---|---|---|
| 可训 🔥(约 1%) | 注入模块(B1:热图 CNN + 零初始化投影;B2:patch 卷积第 4 通道核)+ 动作专家列 LoRA + 动作头 4 个投影 | 约 30M |
| 冻结 ❄ | SigLIP 视觉编码器 + Gemma 语言骨干 + 动作专家列本体 | 0.4B + 2.6B + 0.3B |
上方架构图中已逐组件标注 🔥/❄。注入模块零初始化:训练第 0 步的 B1、B2 与基线 A 逐比特相同,之后的一切分化只能来自热图。
开环:留出 16 集逐帧让模型预测 32 步动作块,与演示真值逐维 L1 比较;三个模型看同一帧、同一噪声(配对),差异只能来自模型本身。主要终点 = subgoal 交接帧(子目标切换 ±0.27 秒,此处最需要"知道下一步该关注哪")。
一个样本 = (留出集, 帧 k)。帧网格每 16 帧一个(对齐"预测 32 步、执行 16 步"),子目标边界 ±8 帧内加密到每 4 帧。第 k 帧预测 32 帧动作块,与真值逐维 L1、沿 32 帧平均、按身体分组平均 → 每样本 4 个数(归一化单位)。原始记录示例:
{ep: 5, k: 0, layer: S4, base: 0.000745, torso: 0.000363, arms: 0.01118, grippers: 0.019018}
分层:subgoal 交接帧 = 距子目标边界 ≤8 帧(±0.27 秒,主要终点,n=449);其余帧 = 交接窗之外(sanity,n=2162)。配对:同帧同噪声,Δ% = 逐样本差值均值 / A 均值,95% 半宽来自差值标准误。
A 与 B1 的逐样本误差曲线几乎重合。开环动作差异量级肉眼不可辨,逐帧预测拼接必然闪烁,故只以统计图呈现;视频素材属于闭环(第二节)。
悬停数据点可看精确数值。* = 95% 区间不含零;零星过线格出现在 sanity 层(其余帧)或不符合预期指纹(真信号应交接帧>其余帧、双臂>夹爪)。
| subgoal 交接帧(归一化 L1 均值) | 其余帧 | |||||||
|---|---|---|---|---|---|---|---|---|
| 模型 | 底盘 | 躯干 | 双臂 | 夹爪 | 底盘 | 躯干 | 双臂 | 夹爪 |
| A 基线 | 0.0121 | 0.0045 | 0.0429 | 0.0341 | 0.0253 | 0.0064 | 0.0237 | 0.0551 |
| B1 token 相加 | 0.0121 | 0.0043 | 0.0430 | 0.0339 | 0.0249 | 0.0063 | 0.0236 | 0.0549 |
各格 A/B1 绝对差 0.0001–0.0004 归一化单位;百分比大的格子(如 S1 躯干 −3.7%)是因为分母小(0.0045,四组最小)。
结论:radio 上 GT 热图作为输入注入未产生可检出的模仿保真度增益——16 格差异全部 ±3.7% 内、方向混合,subgoal 交接帧无一格过显著线(6000 步与 10000 步两档互相复现)。按预先声明的止损条件停止加码,转入第二节:闭环验证与探针追因。