← 返回 09-29 总览
Agent 飞行记录仪 · 抓取小任务 · 3D focus 组 · 罐 0 · 第 2 次
左:世界视角(头部 + 两只手腕三路相机的连续录像,逐帧原样)· 中:agent 实际读入和写出的全部内容,逐字原样 · 右:世界地图(俯视,机器人开局坐标系)· 下:产物架与成对时间轴。点 ▶ 播放,或点时间轴上任意一点跳转;键盘 ← → 逐轮、空格 播放/暂停。
▸ 本组条件:三组提示词的唯一差别
3D focus 组:在共用部分之后多一段:每步动作前,先说清楚下一步决策依赖场景里的哪些部分;把它记成自己构建的 3D 表示,形式不限(点、框、mesh、体素、场景文件都可以);存进 focus/ 文件夹,随情况变化更新,并在决定下一步时使用。原文见下方“起始 prompt”。
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务:机器人开局站在地上一个罐子前 1 m、正对罐子;把罐子抓起来、抬离地面至少 10 cm,然后调用 done()。最多 20 轮(每调用一次观测算一轮),由服务器强制;成功与否由服务器按“某只手持有罐子且罐子比初始高 ≥ 10 cm”判定,判定结果不回给 agent。
agent:GPT-6 Luna(推理强度 max),Codex CLI 0.157.0,经 Harbor 在独立容器里运行;仿真在另一个容器,agent 只能通过客户端接口访问。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。每个动作执行期间另录三路相机过程帧(每秒 5 帧,含每帧本体感知),存在 agent 能读的目录里,看不看由 agent 自己决定。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。
▸ 本跑小结:建了什么、怎么用、过程中的关键时刻
结束:持住罐子并抬高 22.0 cm,第 8 轮开始持罐,共 10 轮(服务器判定成功)。请求 54 次,输入 1.94M token(缓存 1.85M),输出 35.9k(其中推理 24.5k)。全新进程重放:物体最大差 0.0001 m,底盘 0.0 m,一致。
录像只在"世界执行动作"时推进;agent 思考时世界静止(底色变暖)。录像是上帝视角,agent 每轮只拿到一张静态观测(见中栏缩略图)。
世界地图(俯视)
罐子真值初始位置 · 垃圾桶(仅本页可视化,agent 不知道)
底盘轨迹 · 🤖 当前位置与头部相机水平视野
伸手目标:成功到达 · 被规划器拒绝
agent 记录里的罐子位置估计(focus 记录)
产物架 — agent 自己建的文件,标注诞生轮次,点击展开内容
时间轴:每轮一对 —agent 拿观测并思考 世界执行动作 动作被规划器拒绝 · 绿色轮号 = 这一轮开始持有罐子 · 点任意点跳转