← 返回 09-27 总览(第二部分:抓取小任务)
Agent 飞行记录仪 · 抓取小任务 · 无 focus 要求组 · 第二只罐
左:世界视角(头部 + 两只手腕三路相机的连续录像,逐帧原样)· 中:agent 实际读入和写出的全部内容,逐字原样 · 右:世界地图(俯视,机器人开局坐标系)· 下:产物架与成对时间轴。点 ▶ 播放,或点时间轴上任意一点跳转;键盘 ← → 逐轮、空格 播放/暂停。
▸ 本组条件:三组提示词的唯一差别
无 focus 要求组:只有三组共用的部分——目标、接口说明(每个函数做什么、返回什么)、边界规则、20 轮上限、每轮写一行日志、保存所有中间文件。不提 focus。
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务:机器人开局站在地上一个罐子前 1 m、正对罐子;把罐子抓起来、抬离地面至少 10 cm,然后调用 done()。最多 20 轮(每调用一次观测算一轮),由服务器强制;成功与否由服务器按"某只手持有罐子且罐子比初始高 ≥ 10 cm"判定,判定结果不回给 agent。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。
▸ 本跑小结:建了什么、怎么用、过程中的关键时刻
没有建持久模型,只存过测量快照(罐子倒下后的一次轴线拟合),之后没有读回。开局把躯干降到 0.8 以便看到地面,随后两次伸手被规划器拒绝(有关节解,但从当前姿态规划不出轨迹),把躯干抬回后伸手成功。第一次合爪时罐子倒下、没抓住;它拟合倒罐的轴线后重新对准,第二次合爪指尖偏高落空;按腕部深度实测的高度再降,第三次合爪抓住。
录像只在"世界执行动作"时推进;agent 思考时世界静止(底色变暖)。录像是上帝视角,agent 每轮只拿到一张静态观测(见中栏缩略图)。
世界地图(俯视)
罐子真值初始位置(仅本页可视化,agent 不知道)
底盘轨迹 · 🤖 当前位置与头部相机水平视野
伸手目标:成功到达 · 被规划器拒绝
agent 记录里的罐子位置估计(focus 记录)
产物架 — agent 自己建的文件,标注诞生轮次,点击展开内容
时间轴:每轮一对 —agent 拿观测并思考 世界执行动作 动作被规划器拒绝 · 绿色轮号 = 这一轮开始持有罐子 · 点任意点跳转