分类 focus 组:同一位置换成:focus 形式不限(同自由 3D 组),但其中每一项必须标注四类角色之一——target(下一步动作要作用或接触的物体或部件)、constraint(下一步运动必须避开或不能扰动的东西,例如底盘或手臂路径上的障碍物、位置或状态必须保持的物体)、path(下一步运动经过的路线或空间)、check(动作之后必须核对的状态,例如物体有没有移动、倒下、是否到了预期位置)。原文见下方“起始 prompt”。
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务:BEHAVIOR picking_up_trash,机器人从任务原始起点出发。提示词开头与 env.task_goal() 给出同一句目标原文:“Put the three cans of soda from the living room inside the trash can in the kitchen.”(把客厅的三个汽水罐放进厨房的垃圾桶)。最多 120 轮(每调用一次观测算一轮),由服务器强制;判分按 BDDL 目标条件(三个罐子都在垃圾桶里),判定结果不回给 agent。
agent:GPT-6 Luna(推理强度 max),Codex CLI 0.157.0,经 Harbor 在独立容器里运行;仿真在另一个容器,agent 只能通过客户端接口访问。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。每个动作执行期间另录三路相机过程帧(每秒 5 帧,含每帧本体感知),存在 agent 能读的目录里,看不看由 agent 自己决定。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。