01 · TASKarXiv:2610.04432v1 · 2026-10-03

从一段 embodied video,交付一个真的能执行任务的 simulator package

Video2World 测 coding agent 能否同时完成场景重建、robot retargeting(把示范动作转换到目标机器人上)、控制生成与物理调试。

189videos
222instances
39task families
原论文 Figure 1
原论文 Figure 1(CC BY-SA 4.0)1 / 18
02 · PART 0what “world model” means here

这里的 world model 不是未来帧生成,而是可继续操作的世界

Video generation

输出像真的 pixels;不要求对象可碰撞、机器人可控制。

3D reconstruction

恢复 geometry 与 appearance;不一定能完成原任务。

Interactive world modeling

scene、assets、robot、controls 和 physics 全部可执行,且任务 judge 必须通过。

一只看起来很像的瓶子,如果机械臂抓不住、没有立稳或没有松手,Task Success 仍是 0。

论文 Introduction、Section 32 / 18
03 · OVERVIEWagent construction → hidden evaluation

Agent 自己看视频、写 package、运行候选重建;隐藏 evaluator 最后统一执行

原论文 Figure 2
原论文 Figure 2:完整 benchmark overview3 / 18
04 · RELATED WORKthe exact boundary

Video2World 位于 policy、real-to-sim、3D reconstruction 与 simulator coding 的交叉处

路线主要输出缺少 Video2World 的哪一部分
Video2Policy从人类视频学习 robot policy不要求 Agent 交付 scene、assets 与完整 simulator package
Agentic Real2Sim自动化真实世界到 simulation最接近;本文进一步统一 benchmark、隐藏 reference 与多 coding-agent 系统比较
BVB视频到 Blender scene / procedure视觉重建为主,不以 robot actuation 和 task judge 为中心
SceneActBench场景与动作到 simulation任务规格并非主要来自 embodied video
CaP-X / EmbodiedSWErobot code / embodied repo patch分别缺完整环境重建,或不评测新世界的物理执行
论文 Table 1 与 Related Work;相邻论文官方摘要复核4 / 18
05 · DATAeight source groups

189 段视频经过 target configuration 展开成 222 个实例

Robot data

FurnitureBench 64
DROID 20
RoboDojo 25

Human videos

HOI4D 9→18
HOT3D 7→14
DexYCB 11→22
OakInk2 6→12

Other

in-house 37
reconstructed twins 10

为什么会增加

33 段 human video 同时配 arm 与 paired-hand(成对机械手)两种目标配置。

最终是 39 个 task families(共用一套判定逻辑的任务类别);各类等权,样本多的来源不会自动获得更高权重。

Sections 3.1、8.1-8.2;Figure A1 / Tables A2-A45 / 18
06 · ANNOTATIONvideo → evaluation specification

人工复核的对象级评测规则定义任务是否完成,不要求逐像素复刻

原论文 Figure A2

HOI4D bottle transfer

87 帧、15 Hz。标注拿起与松手时刻、瓶子高度轨迹、初始与接收支撑面,以及终态放置的允许范围。

图中的手绘轮廓只是视觉说明,不是 segmentation label(逐像素分割标注);轨迹和条件来自隐藏人工标注,也不会给 Agent。

原论文 Figure A2、Appendix 8.36 / 18
07 · INFORMATION BOUNDARYwhat the agent does and does not know

Agent 只拿到 RGB 与公共接口;reference geometry、trajectory 和 judge 全部隐藏

可以看到

  • RGB 视频、尺寸、帧数
  • simulator / robot 公共说明
  • robot assets、joint limits、control format
  • shell、文件、图像、代码工具
  • 自己的候选重建、渲染画面与报错

不能看到

  • reference scene / mesh
  • 原示范的测量轨迹与 robot logs
  • 隐藏的相机标定参数
  • reference controls / submission
  • 按任务编写的成功条件与 benchmark scores
Sections 3.2、8.3、Appendix 77 / 18
08 · PACKAGEwhat must be executable

提交包同时描述 scene、control protocol 和动作序列

提交与评测协议
protocol.json
actions.npy
scene.json | scene.xml
assets/
expected/obj_poses.npy  # optional
source/
report.md

obj_poses.npy 只声明预期轨迹,不能驱动物体;运动必须由 robot actuation 与 simulator physics 产生。

官方 docs/benchmark.md;Appendix 78 / 18
09 · EVALUATORpackage → verdict

Build、功能、几何和运动来自同一次记录下来的物理执行

1Validate

schema、文件、assets、control array。

2Build

在 SAPIEN / Isaac Sim / MuJoCo 加载。

3Execute

按时间步施加 robot controls。

4Judge

检查事件、顺序、终态与物理有效性。

5Compare

与隐藏 reference 对齐几何和轨迹。

Build 成功只说明 package 能加载。最强系统 build 约 93%,Task Success 却只有 25.5%。

Sections 3.2-3.3;Appendix 9;官方 runner / metrics9 / 18
10 · WORKED CASEDROID upright bottle

真实案例:83 帧视频 → 79×7 controls → 97 个执行状态

原论文 Figure A3
0.4 s

抓住

2.6 s

开始移动

12.8 s

松手

19.2 s

终态通过

输入 640×640、7.5 Hz、约 10.93 s。后 41 个执行状态不进入运动误差,但仍用于判断最终是否释放并静止。

原论文 Figure A3、Appendix 8.410 / 18
11 · TASK JUDGEupright bottle verdict

PASS 不是“最后一帧像直立”,而是支撑、方向、释放与静止同时成立

# simplified from v2w/metrics/task.py:652-675
geometry_ok = supported and angle_deg <= 30
success = geometry_ok and released and quiescent

初态 gate

一开始已满足 upright goal 时,不动作不能得分。

support

support gap < 0.01 mm;clearance 门槛 1 cm。

orientation

upright tolerance 30°;实例终态轴误差 1.78°。

结果

Build=1,Success=1,Progress=100%。

官方 task.py:652–675;Appendix 8.411 / 18
12 · V2WSCOREfunction + geometry + dynamics

先把误差映射成 quality,再按实例、task family 两级聚合

quality(e) = max(0, 1 − e / τ)
F = (Success + Progress) / 2
V2WScore = Build × (F + G + D) / 3

Function F

Task Success 与 stage-wise Progress。

Geometry G

Scene / Shape / Size;主要阈值 τ=10 cm。

Dynamics D

T-APE τ=20 cm;R-APE 90°;T-RPE 10 cm。

瓶子实例按公开公式解释性重算约 80.6,但论文没有发布它的正式 per-instance composite score,不能当官方数值。

v2w/scoring.py:219–305;v2w/config/score.json12 / 18
13 · MAIN RESULTnine agent systems + HAR

Fable-5.1 总分与任务成功率最高;Astra 在部分 object-level geometry 指标最好

主结果重绘
根据原论文 Table 2 重绘;39 个 family 等权平均13 / 18
14 · HUMAN CHECKSpreference and effector motion

HAR 更强,但它能使用额外的原始数据,也不是完美上限

HAR 可使用 CAD、RGB-D、calibration、robot logs、task predicates 与人工调试14 / 18
15 · JUDGE REFINEMENTfunction is not geometry

成功交互与几何误差必须分开;judge 也需要用反例修正

原论文 Figure A5

错误接受

只看终点的规则曾让初态已经满足宽松目标的 lampshade 得分;加入“必须离开初始目标并重新放置”后才修正。

错误拒绝

两个 Astra bottle reconstruction 已直立、支撑、释放,却因错误轴方向与不必要的绝对终点约束被拒;人工复核后改为通过。

原论文 Figure A5、Appendix 8.715 / 18
16 · SAME VIDEO, DIFFERENT FAILUREScase studies

几何接近、终点位置正确或画面里物体被抬高,都不自动等于成功

原论文 Figures A7-A1016 / 18
17 · EMBODIMENT & TIMINGtwo final case studies

同一个任务换 robot 会改变结果;慢几秒也可能功能成功但 motion error 变大

原论文 Figures A12-A1317 / 18
18 · VERDICTinterest 9.2 / 10

可执行评测链已经成立;统计分母和受控系统比较仍需补齐

论文已经建立

  • video → package → physics rollout → judge 的完整 protocol
  • 功能、几何和轨迹分开报告
  • 真实案例暴露多个“看起来对、执行不对”的失败

仍不能忽略

  • 222 / 215 / 179 / 112 四种统计分母未完全对齐
  • OpenCode、Codex CLI、Claude Code 使用的 harness 不同
  • HAR 使用额外信息且人工工时没有系统记录
  • human study 的评审来自作者与公司内部

目前最明确的结论:很多系统能造出可加载的世界,却不能让 robot 在其中稳定完成视频里的任务。

博客作者兴趣度只表示本人兴趣;不是论文质量评级18 / 18