← 返回目录

第一节 · GT 热图作为输入注入(radio,开环)

问题:把逐帧 GT 热图作为额外输入喂给 π0.5,动作预测误差降不降。两种注入方式(B1 token 相加 / B2 第 4 通道)vs 基线 A,同帧同噪声配对比较。

±3.7%
16 格差异全部在此范围内(最大单格 −3.7% 其区间 ±4.4 含零),方向混合
0 / 8
subgoal 交接帧:无一格过显著线
2611
配对样本(16 留出集)
止损
触发预先声明的停止条件 → 转入第二节追因

① 模型架构(底座上加了注入模块 → 画架构图)

pre-trained VLA backbone PaliGemma: SigLIP 400M + Gemma 2.6B — FROZEN ❄ 256 tok 256 tok 256 tok text tok SigLIP ❄ head zed SigLIP ❄ left wrist SigLIP ❄ right wrist “turning_on_radio” task prompt GT heatmap (10Hz→2Hz) CNN (train) 🔥 zero-init proj (train) 🔥 + B1: add to head-cam tokens after SigLIP B2: 4th input channel @ patch-embed conv (that conv trainable) action expert (300M) weights frozen ❄ + LoRA (train) 🔥 noise × 32-step action chunk + robot state (23-d) -1.7 1.25 3.14 1.42 continuous actions (flow matching, 23-d × 32 steps) K/V, every layer frozen ❄ trainable 🔥 (B1/B2 injectors, LoRA, action-head projections) Section 1 · R1–R2 (radio): GT heatmap injected as an extra INPUT — two zero-initialized variants B1 / B2; step 0 ≡ baseline A bit-for-bit

图 1 · 架构与两个注入点。蓝=冻结,橙=可训练;B1 在视觉编码器出口对头部相机 token 逐位置相加,B2 在最入口作第 4 通道。缩略图为真实数据。两者零初始化,第 0 步与基线逐比特相同。

② 训练数据与步数

项值
任务BEHAVIOR-1K turning_on_radio(task-0025,开收音机:走到咖啡桌前,抓起收音机并开启);官方遥操演示数据
数据183 集演示训练 / 16 集留出评测(不参与训练)
步数同一跑程两个存档:R1 = 6000 步中期档,R2 = 10000 步终版;batch 32,LoRA 微调
热图人工审核过的 GT 标注(非预测器输出):10Hz 标注逐语义区域插值到 30Hz,224×224 最大池化保峰值,取值 0–1
对照设计三个模型同数据同步数:基线 A(不加热图)/ B1(token 相加注入)/ B2(第 4 通道注入),唯一差别 = 是否注入热图
实验设置(底座 / 数据 / 训练)
项值
载体π0.5(openpi behavior 分支):三路相机 224×224 + 23 维状态 + 任务文本 → 32 步动作块(23 维/步,流匹配)
底座2025 BEHAVIOR 挑战赛冠军的 50 任务预训练检查点。不用通用底座(动作误差里全是底座噪声),也不用官方 radio 单任务检查点(其本身即基线,无从对照)
任务 / 数据turning_on_radio;183 集训练 / 16 集留出评测
训练LoRA 微调 10000 步,batch 32;可训 = 动作列 LoRA + 动作头投影 + 注入模块
热图口径标注 10Hz → 逐语义区域插值到 30Hz;224×224 最大池化保峰值;取值 0–1

③ 可训与冻结参数

组件规模
可训 🔥(约 1%)注入模块(B1:热图 CNN + 零初始化投影;B2:patch 卷积第 4 通道核)+ 动作专家列 LoRA + 动作头 4 个投影约 30M
冻结 ❄SigLIP 视觉编码器 + Gemma 语言骨干 + 动作专家列本体0.4B + 2.6B + 0.3B

上方架构图中已逐组件标注 🔥/❄。注入模块零初始化:训练第 0 步的 B1、B2 与基线 A 逐比特相同,之后的一切分化只能来自热图。

④ 评测方式

开环:留出 16 集逐帧让模型预测 32 步动作块,与演示真值逐维 L1 比较;三个模型看同一帧、同一噪声(配对),差异只能来自模型本身。主要终点 = subgoal 交接帧(子目标切换 ±0.27 秒,此处最需要"知道下一步该关注哪")。

指标口径:从原始数据到表里的数字

一个样本 = (留出集, 帧 k)。帧网格每 16 帧一个(对齐"预测 32 步、执行 16 步"),子目标边界 ±8 帧内加密到每 4 帧。第 k 帧预测 32 帧动作块,与真值逐维 L1、沿 32 帧平均、按身体分组平均 → 每样本 4 个数(归一化单位)。原始记录示例:

{ep: 5, k: 0, layer: S4, base: 0.000745, torso: 0.000363, arms: 0.01118, grippers: 0.019018}

分层:subgoal 交接帧 = 距子目标边界 ≤8 帧(±0.27 秒,主要终点,n=449);其余帧 = 交接窗之外(sanity,n=2162)。配对:同帧同噪声,Δ% = 逐样本差值均值 / A 均值,95% 半宽来自差值标准误。

单集直观形态(为何开环不做视频)
单集逐样本误差 · 双臂组(留出集 ep102,样本最多的一集) 竖色带 = subgoal 交接帧窗口;两条线几乎重合即本轮结论的直观形态 0.10.20.3A 基线 B1 注入 A 基线 B1 注入 帧号 k(30Hz) 双臂 L1(归一化单位)

A 与 B1 的逐样本误差曲线几乎重合。开环动作差异量级肉眼不可辨,逐帧预测拼接必然闪烁,故只以统计图呈现;视频素材属于闭环(第二节)。

⑤ 结果与结论

开环配对差 Δ%(注入模型 − 基线A,负 = 注入后误差更小) radio · 冠军50任务底座 · 10000步终版 · 2611 配对样本 · 横线 = 95% 置信区间 B1 token相加 B2 第4通道 -8% -6% -4% -2% +0% +2% +4% +6% +8% subgoal 交接帧 主要终点 · n=449 其余帧 sanity · n=2162 底盘 subgoal交接帧 底盘 B1−A: -0.27% ± 2.22-0.3 subgoal交接帧 底盘 B2−A: -1.38% ± 0.76-1.4* 躯干 subgoal交接帧 躯干 B1−A: -3.70% ± 4.39-3.7 subgoal交接帧 躯干 B2−A: -0.65% ± 0.89-0.7 双臂 subgoal交接帧 双臂 B1−A: +0.29% ± 1.31+0.3 subgoal交接帧 双臂 B2−A: -0.35% ± 0.26-0.3* 夹爪 subgoal交接帧 夹爪 B1−A: -0.56% ± 0.98-0.6 subgoal交接帧 夹爪 B2−A: +0.48% ± 0.11+0.5* 底盘 其余帧 底盘 B1−A: -1.40% ± 0.72-1.4* 其余帧 底盘 B2−A: +0.00% ± 0.34+0.0 躯干 其余帧 躯干 B1−A: -1.10% ± 0.99-1.1* 其余帧 躯干 B2−A: -0.41% ± 0.41-0.4* 双臂 其余帧 双臂 B1−A: -0.36% ± 0.62-0.4 其余帧 双臂 B2−A: -0.00% ± 0.20-0.0 夹爪 其余帧 夹爪 B1−A: -0.23% ± 2.04-0.2 其余帧 夹爪 B2−A: +0.33% ± 0.97+0.3

悬停数据点可看精确数值。* = 95% 区间不含零;零星过线格出现在 sanity 层(其余帧)或不符合预期指纹(真信号应交接帧>其余帧、双臂>夹爪)。

原始均值表(看绝对量级)
subgoal 交接帧(归一化 L1 均值)其余帧
模型底盘躯干双臂夹爪底盘躯干双臂夹爪
A 基线0.01210.00450.04290.03410.02530.00640.02370.0551
B1 token 相加0.01210.00430.04300.03390.02490.00630.02360.0549

各格 A/B1 绝对差 0.0001–0.0004 归一化单位;百分比大的格子(如 S1 躯干 −3.7%)是因为分母小(0.0045,四组最小)。

结论:radio 上 GT 热图作为输入注入未产生可检出的模仿保真度增益——16 格差异全部 ±3.7% 内、方向混合,subgoal 交接帧无一格过显著线(6000 步与 10000 步两档互相复现)。按预先声明的止损条件停止加码,转入第二节:闭环验证与探针追因。