← 返回 09-29 总览

Agent 飞行记录仪 · 抓取小任务 · 无 focus 要求组 · 罐 1 · 第 3 次

左:世界视角(头部 + 两只手腕三路相机的连续录像,逐帧原样)· 中:agent 实际读入和写出的全部内容,逐字原样 · 右:世界地图(俯视,机器人开局坐标系)· 下:产物架与成对时间轴。点 ▶ 播放,或点时间轴上任意一点跳转;键盘 ← → 逐轮、空格 播放/暂停。
无 focus 要求组·冒烟3D focus组·冒烟接触部件 focus组·冒烟无 focus 要求组·23D focus组·2接触部件 focus组·2无 focus 要求组·33D focus组·3接触部件 focus组·3无 focus 要求组·43D focus组·4接触部件 focus组·4无 focus 要求组·53D focus组·5接触部件 focus组·5
▸ 本组条件:三组提示词的唯一差别
无 focus 要求组:只有各组共用的部分——目标、接口说明(每个函数做什么、返回什么)、过程帧说明、边界规则、轮数上限(每调用一次观测算一轮)、每轮写一行日志、保存所有中间文件。不提 focus。
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务:机器人开局站在地上一个罐子前 1 m、正对罐子;把罐子抓起来、抬离地面至少 10 cm,然后调用 done()。最多 20 轮(每调用一次观测算一轮),由服务器强制;成功与否由服务器按“某只手持有罐子且罐子比初始高 ≥ 10 cm”判定,判定结果不回给 agent。
agent:GPT-6 Luna(推理强度 max),Codex CLI 0.157.0,经 Harbor 在独立容器里运行;仿真在另一个容器,agent 只能通过客户端接口访问。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。每个动作执行期间另录三路相机过程帧(每秒 5 帧,含每帧本体感知),存在 agent 能读的目录里,看不看由 agent 自己决定。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。
▸ 本跑小结:建了什么、怎么用、过程中的关键时刻
结束:持住罐子并抬高 17.9 cm,第 10 轮开始持罐,共 12 轮(服务器判定成功)。请求 42 次,输入 1.31M token(缓存 1.24M),输出 25.4k(其中推理 19.7k)。全新进程重放:物体最大差 0.0002 m,底盘 0.0001 m,一致。
录像只在"世界执行动作"时推进;agent 思考时世界静止(底色变暖)。录像是上帝视角,agent 每轮只拿到一张静态观测(见中栏缩略图)。

AGENT

世界地图(俯视)

罐子真值初始位置 · 垃圾桶(仅本页可视化,agent 不知道)
底盘轨迹 · 🤖 当前位置与头部相机水平视野
伸手目标:成功到达 · 被规划器拒绝
agent 记录里的罐子位置估计(focus 记录)
产物架 — agent 自己建的文件,标注诞生轮次,点击展开内容

✕

时间轴:每轮一对 —agent 拿观测并思考 世界执行动作 动作被规划器拒绝 · 绿色轮号 = 这一轮开始持有罐子 · 点任意点跳转