← 返回

四、Project Paper Framing

CoF 项目 framing 提纲(基于 /u/zfan3/Downloads/communication_4)

来源:communication_4,单文件,约 20KB。以下为面向 mentor 的 presentation 式提纲;所有观点均转述该文档,判断权在文档作者与 zheyu。

一、Story 主线

1. 问题

长时程 embodied 任务中,agent 需要持续地把抽象的长期意图(goal)和已经发生的交互历史,转化为"此刻视觉世界中哪一小部分空间信息最重要"。文档把这称为一个基本的 intelligence primitive:How should an embodied agent decide what in the visual world matters now?

2. 缺口

当前主流 embodied 模型(VLA 类)把 RGB + language + history 直接映射到 action,中间过程全部压进 latent。perception 与 action 高度 entangled,导致无法区分失败来自 grounding、memory、spatial reasoning 还是 policy 本身。缺少一个位于 vision 与 action 之间、同时满足三个性质的中间表征:语义可解释、空间 dense(逐像素 heatmap 而非文字 CoT)、可与 control 接口(token allocation、crop、grasp candidate、navigation target、policy conditioning)。

3. 我们的主张

提出 Embodied Focus:conditioned on long-horizon intent and interaction history 的 task-relevant 视觉信息空间分布,记为 F_t = f(I_t, M_t, G)。它与 saliency、affordance、grounding、segmentation 均有区别:(a) part-level 且随 task phase 动态变化(approach 看整个杯子,grasp 看杯把,drink 看杯口,place 看杯底与桌面接触区);(b) predictive——navigation 中目标在 FOV 外时,focus 落在即将随转向进入视野的画面区域,表示的已是对未来 task 走向的 relevance;(c) history-dependent——同一帧、同一 goal,历史不同则 focus 不同。人的 gaze 定位为 supervision source,被学习的对象为 Embodied Focus 这个 representation 本身。

4. 证据路径

文档给出的完整 evidence chain:goal 决定 task-dependent relevance;history 决定当前 latent task state;三者结合产生 dynamic、part-level 的空间任务表征。需要实验证明:(1) F_t ≠ f(I_t, G),即 memory 的收益集中出现在 object revisitation、occlusion、phase transition、navigation turn 等场景;(2) manipulation 中出现 phase-dependent part grounding;(3) navigation 中出现 predictive/off-target relevance;(4) unseen 情形泛化;(5) 最关键的 causal utility——focus-conditioned policy 在 clutter、长程依赖、task transition 等 failure regime 上优于 baseline policy。

二、关键概念

  • **Embodied Focus**:给定长期 goal 与交互历史,当前画面中各位置对下一步行为的重要性分布 H_t(x,y) ∈ [0,1]。
  • **Task phase / latent task state**:任务进行到哪一步的内部状态;当前帧与 goal 无法唯一确定它,需从历史推断。
  • **Memory 的角色**:从历史推断当前 task state,回答"发生过什么、我在哪个阶段";目的在于状态推断而非存储更多帧。
  • **Part-level dynamic grounding**:同一物体在不同 phase 下 relevance 落在不同部件;表征隐式包含 task phase × object part × spatial geometry。
  • **Predictive relevance**:focus 可以落在当前无目标物体的区域(如即将转向进入视野的一侧),表示对任务未来走向的相关性。
  • **Causal utility**:focus 表征接入 downstream policy 后能改善 embodied 行为,从而证明它属于 useful computation 而非 post-hoc 可解释产物。
  • **Multi-rate 假设**:视觉外观变化快(perception 流 10 Hz),task state 变化慢(memory 流 1–2 Hz),输出可上采样到 10–50 Hz 服务 control。
  • 三、文档的论证结构(推理链)

    1. **为什么要做 memory**:同一当前帧 + 同一 goal,在"还在找杯子"与"已拿起杯子"两种历史下,正确 focus 不同 → I_t + G 不足以决定 F_t → 必须有 M_t → memory 承担从历史推断 task state 的功能,属于论文核心而非 peripheral engineering。进一步约束:memory ablation 要回答"focus prediction 依赖哪种 memory abstraction(what/where/task-state/temporal ordering/object permanence 等)",单纯比较 token 数属于 engineering。

    2. **为什么以 heatmap(人的 focus)为 GT**:需要的中间表征必须空间 dense 且直接落回真实世界,文字 CoT 达不到该粒度;人的 gaze 提供了可采集的 spatial task relevance prior,作为 supervision source 使用;同时文档明确警告不能把 human gaze 等同于 optimal robot attention,工作不应锁死成 gaze imitation。

    3. **为什么在 BEHAVIOR 数据上做**:memory 论点成立的前提在于 trajectory 足够长(1–2 分钟)且包含多个 task phase;任务只有 5 秒时当前 observation 已足够,memory architecture 失去研究意义。BEHAVIOR(Behavioral Challenge)的长时程、多 phase 轨迹恰好提供 focus 的 history-dependence 可被观测和量化的场景。

    4. **三轴实验设计的意义**:conditioning × memory × vision(DINO/CLIP)三个轴分别对应 WHY(goal 解释为何该区域重要)、WHEN/STATE(memory 解释处于什么阶段)、WHAT/WHERE(视觉特征解释那里有什么、在哪),共同构成"推断 embodied focus 需要哪些信息"的 scientific decomposition,目的在于回答问题而非刷最高数字。

    四、后续实验方向清单(文档归纳)

    1. Memory necessity:对比 I_t+G 与 I_t+G+M_t,并定位收益集中的场景类型(revisitation、hidden target、phase transition、navigation turn、长时依赖)。

    2. Memory abstraction ablation:不同 memory 内容/抽象方式的比较,超出 token 数量扫描。

    3. Memory temporal bandwidth:memory 采样率扫描(如 2 Hz vs 1 Hz vs 0.25 Hz),检验 task state 低带宽假设;multi-rate 架构(fast perception / slow memory)。

    4. 三轴 grid:goal conditioning 方式 × memory 设计 × 视觉特征(DINO、CLIP、DINO+CLIP)。

    5. Goal conditioning 位置:decoder fusion 与 memory retrieval 阶段注入的对比(goal 决定"过去什么值得回忆")。

    6. Downstream causal utility:focus-conditioned policy 与 baseline policy 在 unseen environment、distractor、长轨迹、novel configuration、partial observability 上的对比;重点看 failure regime 的改善。

    7. 结构规律发现:part-level focus 对高频当前视觉与长时 memory 的依赖分工、phase switching 对 sparse episodic memory 的依赖、DINO/CLIP 在 where/what 上的互补性等。

    8. Transferability(远期):focus model 作为 navigation/manipulation policy conditioning、VLA auxiliary target、token pruning criterion、visual memory write criterion 的复用。

    五、附录

    逻辑最强的 3 个论点(原文摘录)

    1. "goal 本身不会告诉模型当前这 100 ms 应该看哪里。……这本质上是一个 temporal credit assignment / grounding 问题。你们的 memory 因此不是为了'记住更多 frame'。它真正承担的是:从历史里推断当前 task state。"(§2)

    2. "focus 不再等价于 segmentation。甚至不等价于 affordance。它更接近:P(future task relevance | I_t, M_t, G)。"(§5,navigation FOV 外转向例子)

    3. "人的 gaze 可以是 supervision source。Embodied Focus 才应该是 representation being learned。"(§14)

    讲给 mentor 时最可能被追问的 3 个问题

    1. 隐式 VLA attention 为何不够——需要证明 explicit focus 更好学、更泛化、更易做 memory、或确实帮助 downstream action,至少满足其一(文档 §14 第三问)。

    2. 人的 focus 为何值得学习——gaze 含 visual search、distraction、个体习惯等噪声,需要论证 human focus ≈ useful spatial task relevance prior,并说明如何避免锁进 gaze imitation 口径(文档 §14 第四问,文档称其为最难的问题)。

    3. Causal utility 实验计划——heatmap 指标之外,downstream policy 实验做不做、在哪个 setting 做、baseline 怎么设;若不做,scientific claim 会缩水成 post-hoc interpretable prediction task(文档 §8–9)。

    接下来聚焦的实验

    (a) Memory 的进一步 ablation

  • Stage B:固定最优 selector, 比较 C16 / M16(4×4 网格 + 2D PE) / CM16(C 的 attention 权重同时写 WHAT 与 WHERE);M49 作容量对照。
  • Stage C:budget 敏感性 B ∈ {4, 8, 12}(recent 固定为总预算 1/4)。
  • 全量数据重跑 + 固定大评测集终评;memory 定型后再做 frozen vision(CLIP / DINO / CLIP+DINO)。
  • (b) 真机实验探索

  • 标注管线向真机相机流的迁移:无仿真 GT 时接触/gaze 代理信号的获取。
  • focus heatmap 对下游 policy 的 causal utility:以 focus 为条件的操作策略在长时程任务上的成功率对比。
  • 真机 memory 论证:同一场景不同交互历史下 focus 输出的分化。