[2026-10-03] Video2World: Benchmarking Coding Agents for Interactive World Modeling from Embodied Videos
Video2World 如何把单段具身视频变成可执行模拟器重建任务:逐项拆解 222 个实例的来源、Agent 可见边界、submission package、物理执行、task judge、V2WScore、真实…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
Video2World 如何把单段具身视频变成可执行模拟器重建任务:逐项拆解 222 个实例的来源、Agent 可见边界、submission package、物理执行、task judge、V2WScore、真实…
Sampling SFT 如何把偏离基础模型分布的专家解题记录改写成更易学习的训练数据;逐步区分信息投影、理论采样规则、公开的贪心实现、真实案例与实验结果。
V-Rubrics 怎样把视觉回答拆成视觉忠实度、推理一致性和指令遵循三类评分项,再把训练权重分配到相关回答前缀;包含真实 AI2D 样本、判分输入、奖励重算与公开实现差异。
GAGAR 如何比较多次通过测试的代码修改质量,再重新分配训练权重;拆解判分 Agent、计算公式、训练结果、带上限的实现与未公开证据。
ASTRA 怎样从 MCP tool graph 合成 SFT trajectories,再把 QA decomposition 编译成可执行 RL environments;逐层拆清数据、judge、reward…
RecreationWorld 怎样用 250 个五平台复刻任务,检验 Agent 能否在 GUI 探索、写代码、运行和验证之间自主往返;逐项拆清任务来源、隐藏测试、Logbert 真实 case、评分公式、模型结…
Code-CoT 如何把几何推理变成可寻址事件,CE-GRPO 又怎样从同一 prefix 分叉完整 future,用终局差异把 credit 落到真正改变结果的位置。
让 Claude Code 读取全部候选代码、分数与原始执行轨迹,再由独立外层程序验证和评测新 harness:本文拆解 Meta-Harness 的搜索闭环、三组实验、TerminalBench 真实迭代与证据边…
固定模型、轨迹、reward 与更新次数,只改变 GRPO 的分组边界:这篇工作用四种 coding harness 和一个 held-out weak-ReAct,区分 source-configuration…
从一条真实 ClawGym-Bench 任务入手,拆解 ClawGym II 如何在不改写 OpenClaw 与 Claude Code 内部逻辑的前提下恢复 prefix tree、计算 PPO/GRPO rew…