← 返回 09-27 总览(第二部分:抓取小任务)
Agent 飞行记录仪 · 抓取小任务 · 接触部件 focus 组 · 第二只罐
左:世界视角(头部 + 两只手腕三路相机的连续录像,逐帧原样)· 中:agent 实际读入和写出的全部内容,逐字原样 · 右:世界地图(俯视,机器人开局坐标系)· 下:产物架与成对时间轴。点 ▶ 播放,或点时间轴上任意一点跳转;键盘 ← → 逐轮、空格 播放/暂停。
▸ 本组条件:三组提示词的唯一差别
接触部件 focus 组:同一位置换成更具体的一段:focus 必须是“下一次接触所依赖的物体部件”的 3D 模型(例如手指将要夹住的那一段罐壁),不能是整个物体或整个场景;形式为局部 mesh 或拟合的几何基元;每次接触或抓取尝试之后重新测量并更新,接触前建的模型在重测前一律视为未核实。原文见下方“起始 prompt”。
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务:机器人开局站在地上一个罐子前 1 m、正对罐子;把罐子抓起来、抬离地面至少 10 cm,然后调用 done()。最多 20 轮(每调用一次观测算一轮),由服务器强制;成功与否由服务器按"某只手持有罐子且罐子比初始高 ≥ 10 cm"判定,判定结果不回给 agent。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。
▸ 本跑小结:建了什么、怎么用、过程中的关键时刻
按要求建接触部件模型:罐壁中段接触带(圆柱拟合,半径 3.76 cm,罐子实际 3.7 cm;另建一块 130 个顶点、64 个面的局部 mesh),在下探、对准、合爪、抬起四个阶段各重测一次,并按里程计把模型换算到新的底盘位置。开局放低躯干,两次伸手被规划器拒绝后抬回。下探碰得罐子偏移 1.4 cm,重测后把夹爪对中到 3 mm 以内抓住。
录像只在"世界执行动作"时推进;agent 思考时世界静止(底色变暖)。录像是上帝视角,agent 每轮只拿到一张静态观测(见中栏缩略图)。
世界地图(俯视)
罐子真值初始位置(仅本页可视化,agent 不知道)
底盘轨迹 · 🤖 当前位置与头部相机水平视野
伸手目标:成功到达 · 被规划器拒绝
agent 记录里的罐子位置估计(focus 记录)
产物架 — agent 自己建的文件,标注诞生轮次,点击展开内容
时间轴:每轮一对 —agent 拿观测并思考 世界执行动作 动作被规划器拒绝 · 绿色轮号 = 这一轮开始持有罐子 · 点任意点跳转