← 返回 2026-08-05 会议

诊断坍塌 · 2026-08-05 · Training

全视频 2Hz 流式训练那一轮对输入失明地塌了。这里把根因追到底。
两条结论:记忆必须可学 (learnable) · 损失不能是 MSE。

① · 起点:一轮塌了,另一轮没塌

新 2Hz 流式轮 → 对每帧都吐同一张静态平均图,失明;更早的段式轮没塌,喂错帧相关性立刻崩。

细节
结果:新轮 ΔFrames=0,预测与输入无关;旧段式轮 held-out CC=0.541,swap 喂错帧→0.057(真在看图)。
问题:为什么新轮塌、旧轮不塌?

② · 假设一:是损失吗? — 不是

稀疏前景上 MSE 最优解=预测平均图(均值塌缩)。但在正式训练里换前景加权损失,改善不大。

细节
逼出更底层的疑问:会不会连"把单独一条轨迹背下来"都做不到?→ 退回过拟合探针。

③ · 退一步:能背下一条吗?(过拟合探针)

只过拟合单条轨迹,拆开长度/密度/焦点数/导航内容四个因素。

四种取帧方式(一条"putting dishes away"轨迹):灰=导航 蓝=操作;下方为各采样取到的帧。
四种取法
全帧 2Hz(长+密) / 每子目标一帧(长+多焦点+稀疏) / 天然短轨迹(短+少焦点) / 纯操作短段(2–4焦点)。想回答:决定"背不背得动"的是哪条轴?

④ · 喂入顺序? — 无关

按时间顺序喂 vs 打乱顺序喂,更新对齐后几乎相等、无方向 → 流式顺序不是诱因。

⑤ · 长度还是密度?(等长对照) — 表面像密度

锁死长度,"稀疏多焦点" vs "稠密少焦点":0.18 vs 0.72,看着像"焦点越多越难"。(后被推翻)

⑥ · 记忆学不学?(主动 ablation) — 真凶

把"记忆要点写法"从固定不学切到端到端一起学。逐阶段单帧 0.15 → 0.76,趋势⑤随之崩。

两条杠杆:记忆可学(蓝) + 前景加权损失(绿)。逐阶段单帧从 0.15→0.76→0.88。
逐阶段单帧收敛:记忆冻结上不去,激活后才背得动。
MSE 几乎不给记忆编码器梯度(~1e-9),前景加权大 100×(~1e-7)。
三条杠杆结果
记忆激活:逐阶段单帧 0.15→0.76(单靠去 detach,+0.61)=多焦点拟合不动的主因。
前景加权损失:四组普涨到 0.70–0.91,记忆梯度大 100×=第二独立杠杆。
加容量(加层/每层注目标):几乎不动(0.75–0.79)=不是瓶颈。
记忆一激活,⑤的"焦点越多越难"趋势崩塌(稀疏多焦点追平稠密少焦点)→ 那是"记忆冻结"造的假象。

⑦ · 推理结果 · GT vs prediction(记忆激活)

左 RGB · 中 GT · 右 prediction。记忆激活+前景加权 overfit 后,预测贴合 GT。

逐阶段单帧(每子目标1帧,1Hz)
稠密单段(连续帧,2Hz)
天然短轨迹(1Hz)
纯操作短段(1Hz)

结论

① 记忆必须是 learnable 的(冻结→多焦点背不动;激活→0.15 跳 0.76)。
② 损失不能是 MSE(前景加权→四组进 0.7–0.9,且给记忆梯度大 100×)。
长度/容量都不是瓶颈;"密度趋势"是记忆冻结的假象。

待办 (TODO)
1 采样策略(最终训练):单 subgoal 采样密度 vs 总 subgoal 数的帕累托,受 budget(帧数/参数/延迟)约束——2Hz 全帧记忆激活 BPTT 显存 O(T²),实测 704 帧即 OOM>42GB,不可能全帧。
2 正式训练验证:在真训练里同时"记忆激活 + 前景加权",看留出测试集能否被救、对齐旧轮 0.541。