来源:communication_4,单文件,约 20KB。以下为面向 mentor 的 presentation 式提纲;所有观点均转述该文档,判断权在文档作者与 zheyu。
长时程 embodied 任务中,agent 需要持续地把抽象的长期意图(goal)和已经发生的交互历史,转化为"此刻视觉世界中哪一小部分空间信息最重要"。文档把这称为一个基本的 intelligence primitive:How should an embodied agent decide what in the visual world matters now?
当前主流 embodied 模型(VLA 类)把 RGB + language + history 直接映射到 action,中间过程全部压进 latent。perception 与 action 高度 entangled,导致无法区分失败来自 grounding、memory、spatial reasoning 还是 policy 本身。缺少一个位于 vision 与 action 之间、同时满足三个性质的中间表征:语义可解释、空间 dense(逐像素 heatmap 而非文字 CoT)、可与 control 接口(token allocation、crop、grasp candidate、navigation target、policy conditioning)。
提出 Embodied Focus:conditioned on long-horizon intent and interaction history 的 task-relevant 视觉信息空间分布,记为 F_t = f(I_t, M_t, G)。它与 saliency、affordance、grounding、segmentation 均有区别:(a) part-level 且随 task phase 动态变化(approach 看整个杯子,grasp 看杯把,drink 看杯口,place 看杯底与桌面接触区);(b) predictive——navigation 中目标在 FOV 外时,focus 落在即将随转向进入视野的画面区域,表示的已是对未来 task 走向的 relevance;(c) history-dependent——同一帧、同一 goal,历史不同则 focus 不同。人的 gaze 定位为 supervision source,被学习的对象为 Embodied Focus 这个 representation 本身。
文档给出的完整 evidence chain:goal 决定 task-dependent relevance;history 决定当前 latent task state;三者结合产生 dynamic、part-level 的空间任务表征。需要实验证明:(1) F_t ≠ f(I_t, G),即 memory 的收益集中出现在 object revisitation、occlusion、phase transition、navigation turn 等场景;(2) manipulation 中出现 phase-dependent part grounding;(3) navigation 中出现 predictive/off-target relevance;(4) unseen 情形泛化;(5) 最关键的 causal utility——focus-conditioned policy 在 clutter、长程依赖、task transition 等 failure regime 上优于 baseline policy。
1. **为什么要做 memory**:同一当前帧 + 同一 goal,在"还在找杯子"与"已拿起杯子"两种历史下,正确 focus 不同 → I_t + G 不足以决定 F_t → 必须有 M_t → memory 承担从历史推断 task state 的功能,属于论文核心而非 peripheral engineering。进一步约束:memory ablation 要回答"focus prediction 依赖哪种 memory abstraction(what/where/task-state/temporal ordering/object permanence 等)",单纯比较 token 数属于 engineering。
2. **为什么以 heatmap(人的 focus)为 GT**:需要的中间表征必须空间 dense 且直接落回真实世界,文字 CoT 达不到该粒度;人的 gaze 提供了可采集的 spatial task relevance prior,作为 supervision source 使用;同时文档明确警告不能把 human gaze 等同于 optimal robot attention,工作不应锁死成 gaze imitation。
3. **为什么在 BEHAVIOR 数据上做**:memory 论点成立的前提在于 trajectory 足够长(1–2 分钟)且包含多个 task phase;任务只有 5 秒时当前 observation 已足够,memory architecture 失去研究意义。BEHAVIOR(Behavioral Challenge)的长时程、多 phase 轨迹恰好提供 focus 的 history-dependence 可被观测和量化的场景。
4. **三轴实验设计的意义**:conditioning × memory × vision(DINO/CLIP)三个轴分别对应 WHY(goal 解释为何该区域重要)、WHEN/STATE(memory 解释处于什么阶段)、WHAT/WHERE(视觉特征解释那里有什么、在哪),共同构成"推断 embodied focus 需要哪些信息"的 scientific decomposition,目的在于回答问题而非刷最高数字。
1. Memory necessity:对比 I_t+G 与 I_t+G+M_t,并定位收益集中的场景类型(revisitation、hidden target、phase transition、navigation turn、长时依赖)。
2. Memory abstraction ablation:不同 memory 内容/抽象方式的比较,超出 token 数量扫描。
3. Memory temporal bandwidth:memory 采样率扫描(如 2 Hz vs 1 Hz vs 0.25 Hz),检验 task state 低带宽假设;multi-rate 架构(fast perception / slow memory)。
4. 三轴 grid:goal conditioning 方式 × memory 设计 × 视觉特征(DINO、CLIP、DINO+CLIP)。
5. Goal conditioning 位置:decoder fusion 与 memory retrieval 阶段注入的对比(goal 决定"过去什么值得回忆")。
6. Downstream causal utility:focus-conditioned policy 与 baseline policy 在 unseen environment、distractor、长轨迹、novel configuration、partial observability 上的对比;重点看 failure regime 的改善。
7. 结构规律发现:part-level focus 对高频当前视觉与长时 memory 的依赖分工、phase switching 对 sparse episodic memory 的依赖、DINO/CLIP 在 where/what 上的互补性等。
8. Transferability(远期):focus model 作为 navigation/manipulation policy conditioning、VLA auxiliary target、token pruning criterion、visual memory write criterion 的复用。
1. "goal 本身不会告诉模型当前这 100 ms 应该看哪里。……这本质上是一个 temporal credit assignment / grounding 问题。你们的 memory 因此不是为了'记住更多 frame'。它真正承担的是:从历史里推断当前 task state。"(§2)
2. "focus 不再等价于 segmentation。甚至不等价于 affordance。它更接近:P(future task relevance | I_t, M_t, G)。"(§5,navigation FOV 外转向例子)
3. "人的 gaze 可以是 supervision source。Embodied Focus 才应该是 representation being learned。"(§14)
1. 隐式 VLA attention 为何不够——需要证明 explicit focus 更好学、更泛化、更易做 memory、或确实帮助 downstream action,至少满足其一(文档 §14 第三问)。
2. 人的 focus 为何值得学习——gaze 含 visual search、distraction、个体习惯等噪声,需要论证 human focus ≈ useful spatial task relevance prior,并说明如何避免锁进 gaze imitation 口径(文档 §14 第四问,文档称其为最难的问题)。
3. Causal utility 实验计划——heatmap 指标之外,downstream policy 实验做不做、在哪个 setting 做、baseline 怎么设;若不做,scientific claim 会缩水成 post-hoc interpretable prediction task(文档 §8–9)。