← 返回 09-27 总览(第一部分)
Agent 飞行记录仪
· mesh focus 组 · 第1跑 · picking up trash
左:上帝视角(头部相机连续录像+我们叠加的注释, 非 agent 所见) · 右:agent 实际消费的信息, 逐字节原样、永不加工 · 下:产物架(点开看内容)与成对时间轴 ·
看本组第2跑 →
与成对时间轴
▸ 起始 prompt(发给 agent 的原文,逐字)
加载中…
▸ 任务与输入(这只 agent 到底拿到什么)
任务 goal — env.task_goal() 返回的原文只有一句: "picking up trash"。更细的要求全在起始 prompt 里(见上一个下拉框)。 Agent 每轮可获得的全部输入(没有别的): · RGB 图像 ×3: 头部 + 左腕 + 右腕 (480×480) · 头部相机原始深度图 (.npy) · 相机内参 K + 各相机在底盘上的安装位姿(手眼标定) · 本体感知: 关节角 / 底盘系夹爪位姿 / 相对 episode 起点的里程计 / 持物标志 · 任务文本(上面那句) 明确不提供: 任何物体的位置或身份、世界坐标外参、场景资产。 运动规划器只知道机器人自身(关节限位/自碰撞), 不知道环境——避障完全靠 agent。
▸ focus 记录是怎么产生和使用的(机制说明)
本跑(mesh focus 组)机制实况,逐字核对自写脚本与会话记录: 1. 每轮 focus 流程:把当前头部深度图三角化成表面补丁,变换到 episode 起点固定系,追加进累积网格 scene.ply/scene.npz(第 1 跑最终 76 万顶点/140 万面片);由模型给的 2D ROI(∪持久 3D 活动区)给面片打 focus 分。 2. mesh→决策的通道:focus 流程把"点亮面片数 + 3D 包围盒"打印返回模型上下文,模型据此定动作参数;mesh 文件本身与逐轮 journal 均几乎不被回读。 3. 自查产物:每轮生成"focus 面片投影回 RGB"的自查图(本页右栏原样展示),两跑合计 110 张,回看次数 0–1——agent 用数值摘要替代了视觉核对。 4. 全程 pip 安装 0 次;网格构建/投影/打分全部为自写 numpy 脚本。mesh 仅作空间参照,未接入任何物理推演。
左腕相机(每轮观测时刷新)
右腕相机(每轮观测时刷新)
AGENT
世界地图 — 累积 mesh(面片质心俯视) · 金框=本轮 focus 包围盒
灰点=mesh 面片质心 · 金框=本轮 focus 包围盒 · 蓝线=底盘轨迹; 面片在被测量的那一轮出现
mesh 三维查看器 — agent 建的真实网格(拖拽旋转/滚轮缩放) · 随轮次生长
加载网格中…
产物架 — 每件产物标注其诞生轮次,点击展开内容
✕
时间轴: 每轮一对 —
agent 拿观测并思考
世界 rollout(执行动作) · 点任意点跳转
▶ 播放
正常
跳过思考轮
打字速度