← 返回 40 对 40 次列表 ← 返回 10-04 主页面

Agent 飞行记录仪 · 长程捡垃圾任务 · 分类 focus 组 · 第 38 次

左:世界视角(头部 + 两只手腕三路相机的连续录像,逐帧原样)· 中:agent 实际读入和写出的全部内容,逐字原样 · 右:世界地图(俯视,机器人开局坐标系)· 下:产物架与成对时间轴。点 ▶ 播放,或点时间轴上任意一点跳转;键盘 ← → 逐轮、空格 播放/暂停。
不建 focus·1不建 focus·2不建 focus·3不建 focus·4不建 focus·5不建 focus·6不建 focus·7不建 focus·8不建 focus·9不建 focus·10不建 focus·11不建 focus·12不建 focus·13不建 focus·14不建 focus·15不建 focus·16不建 focus·17不建 focus·18不建 focus·19不建 focus·20不建 focus·21不建 focus·22不建 focus·23不建 focus·24不建 focus·25不建 focus·26不建 focus·27不建 focus·28不建 focus·29不建 focus·30不建 focus·31不建 focus·32不建 focus·33不建 focus·34不建 focus·35不建 focus·36不建 focus·37不建 focus·38不建 focus·39不建 focus·40分类 focus·1分类 focus·2分类 focus·3分类 focus·4分类 focus·5分类 focus·6分类 focus·7分类 focus·8分类 focus·9分类 focus·10分类 focus·11分类 focus·12分类 focus·13分类 focus·14分类 focus·15分类 focus·16分类 focus·17分类 focus·18分类 focus·19分类 focus·20分类 focus·21分类 focus·22分类 focus·23分类 focus·24分类 focus·25分类 focus·26分类 focus·27分类 focus·28分类 focus·29分类 focus·30分类 focus·31分类 focus·32分类 focus·33分类 focus·34分类 focus·35分类 focus·36分类 focus·37分类 focus·38分类 focus·39分类 focus·40
▸ 本组条件:三组提示词的唯一差别
分类 focus 组:同一位置换成:focus 形式不限(同自由 3D 组),但其中每一项必须标注四类角色之一——target(下一步动作要作用或接触的物体或部件)、constraint(下一步运动必须避开或不能扰动的东西,例如底盘或手臂路径上的障碍物、位置或状态必须保持的物体)、path(下一步运动经过的路线或空间)、check(动作之后必须核对的状态,例如物体有没有移动、倒下、是否到了预期位置)。原文见下方“起始 prompt”。
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务:BEHAVIOR picking_up_trash,机器人从任务原始起点出发。提示词开头与 env.task_goal() 给出同一句目标原文:“Put the three cans of soda from the living room inside the trash can in the kitchen.”(把客厅的三个汽水罐放进厨房的垃圾桶)。最多 120 轮(每调用一次观测算一轮),由服务器强制;判分按 BDDL 目标条件(三个罐子都在垃圾桶里),判定结果不回给 agent。
agent:GPT-6 Luna(推理强度 max),Codex CLI 0.157.0,经 Harbor 在独立容器里运行;仿真在另一个容器,agent 只能通过客户端接口访问。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。每个动作执行期间另录三路相机过程帧(每秒 5 帧,含每帧本体感知),存在 agent 能读的目录里,看不看由 agent 自己决定。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。
▸ 本跑小结:建了什么、怎么用、过程中的关键时刻
结束:共 103 轮,仿真目标判定(三个罐子都在垃圾桶里)未完成;结束时垃圾桶里有 0 个罐子(逐罐判定),拿起罐子共 6 次;垃圾桶被碰倒:C 碰倒前画面里从没出现过桶(第 18 轮)。请求 331 次,输入 41.94M token(缓存 41.02M),输出 296.4k(其中推理 181.6k)。
录像只在"世界执行动作"时推进;agent 思考时世界静止(底色变暖)。录像是上帝视角,agent 每轮只拿到一张静态观测(见中栏缩略图)。

AGENT

世界地图(俯视)

罐子真值初始位置 · 垃圾桶(仅本页可视化,agent 不知道)
底盘轨迹 · 🤖 当前位置与头部相机水平视野
伸手目标:成功到达 · 被规划器拒绝
agent 记录里的罐子位置估计(focus 记录)
产物架 — agent 自己建的文件,标注诞生轮次,点击展开内容

✕

时间轴:每轮一对 —agent 拿观测并思考 世界执行动作 动作被规划器拒绝 · 绿色轮号 = 这一轮开始持有罐子 · 点任意点跳转