任务:BEHAVIOR picking_up_trash,机器人从任务原始起点出发。提示词开头与 env.task_goal() 给出同一句目标原文:“Put the three cans of soda from the living room inside the trash can in the kitchen.”(把客厅的三个汽水罐放进厨房的垃圾桶)。最多 120 轮(每调用一次观测算一轮),由服务器强制;判分按 BDDL 目标条件(三个罐子都在垃圾桶里),判定结果不回给 agent。
agent:GPT-6 Luna(推理强度 max),Codex CLI 0.157.0,经 Harbor 在独立容器里运行;仿真在另一个容器,agent 只能通过客户端接口访问。
agent 每轮能拿到的全部输入:三路 RGB(头部、左腕、右腕,480×480)、头部深度图、各相机内参与相对底盘的安装位姿、本体感知(关节角、底盘系夹爪位姿、相对开局的里程计、每只手是否持物)、任务文本。每个动作执行期间另录三路相机过程帧(每秒 5 帧,含每帧本体感知),存在 agent 能读的目录里,看不看由 agent 自己决定。
明确不提供:任何物体的位置或身份、世界坐标外参、场景资产。运动规划器只知道机器人自身(关节限位、自碰撞),不知道环境中的物体。