← 所有日期

10-06 加 / 不加 focus:5 个任务的典型回放

embodied first exam 标准模式(只给相机图像和关节状态,不能重置)里挑的 5 个 Astra 没做成的任务;模型 Solar(Codex,推理强度 max);每个任务不加 focus、加 focus 各跑 6 次。加 focus 指每步动作前,让 agent 用三维形式记下要碰的物体、要避开的东西、动作后要核对的状态。

结果

任务不加 focus加 focus主要失败原因(仿真重放核实)
把勺子放进杯子5/64/6勺子抬起后滑落、碰倒杯子
把红杯子摆正2/63/6翻转途中杯子从夹爪里滑出
两个杯子放上架子0/60/6杯子抓住后滑落,或夹住了提不起来
关水龙头0/60/6这个水龙头往下压是开得更大、往上抬才是关;agent 一直往下压
打开左前炉头1/60/6认错旋钮:最左边两个旋钮管的是后排炉头
合计8/307/30两组找位置一样准:RoboLab 三个任务里,夹爪合拢时离物体表面中位都是 0.9 cm

RoboLab 的三个任务视频是三路相机并排(正面 / 左肩 / 手腕),每秒 15 帧对应 15 个控制步;RoboCasa 的两个任务只有一路相机。

RoboLab:抓得准,但拿不稳

1 · 把勺子放进杯子成功不加 focus 第 6 次

2 · 把勺子放进杯子失败不加 focus 第 4 次

3 · 两个杯子放上架子失败不加 focus 第 6 次

4 · 把红杯子摆正成功不加 focus 第 3 次

5 · 把红杯子摆正失败不加 focus 第 6 次

RoboCasa 的相机画面有问题

RoboCasa 两个任务里红白闪烁、机械臂发绿,是 benchmark 生成相机画面时把物体的碰撞外壳(物理计算用的简化几何,家具为红色、机器人为绿色)和真实外观一起画了出来,两者叠在同一表面上互相遮挡。agent 拿到的图像就是左图;启能那边 Astra 跑同一任务的画面也一样。右图是同一时刻隐藏碰撞外壳后的画面。

agent 实际拿到的画面(关水龙头任务开局,正面相机)
同一时刻、隐藏碰撞外壳后

因此下面两个 RoboCasa 任务的失败分析,是在相机画面被遮挡的条件下得到的,要在修好画面后重新跑过才能定论。

RoboCasa:动作做到了,但对"动这个会发生什么"判断错了

6 · 关水龙头失败加 focus 第 4 次

7 · 打开左前炉头失败不加 focus 第 1 次

下面两张是这次运行中 agent 自己看过的图(从它的会话记录里原样取出):左图是开局时四路相机的画面,台面的红白条纹在 agent 拿到的图像里本来就有,远处三路相机分辨率只有 320×240,旋钮看不清;右图是 agent 把手移到灶台上方后、用手腕相机拍下再放大的画面,最下面一排带 D 形刻度的就是旋钮。旋钮看得见,但看不出哪个旋钮管哪个炉头。

8 · 打开左前炉头成功不加 focus 第 3 次

9 · 打开左前炉头失败加 focus 第 1 次