[2026-09-18] RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
RecreationWorld 怎样用 250 个五平台复刻任务,检验 Agent 能否在 GUI 探索、写代码、运行和验证之间自主往返;逐项拆清任务来源、隐藏测试、Logbert 真实 case、评分公式、模型结…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
RecreationWorld 怎样用 250 个五平台复刻任务,检验 Agent 能否在 GUI 探索、写代码、运行和验证之间自主往返;逐项拆清任务来源、隐藏测试、Logbert 真实 case、评分公式、模型结…
Code-CoT 如何把几何推理变成可寻址事件,CE-GRPO 又怎样从同一 prefix 分叉完整 future,用终局差异把 credit 落到真正改变结果的位置。
让 Claude Code 读取全部候选代码、分数与原始执行轨迹,再由独立外层程序验证和评测新 harness:本文拆解 Meta-Harness 的搜索闭环、三组实验、TerminalBench 真实迭代与证据边…
固定模型、轨迹、reward 与更新次数,只改变 GRPO 的分组边界:这篇工作用四种 coding harness 和一个 held-out weak-ReAct,区分 source-configuration…
从一条真实 ClawGym-Bench 任务入手,拆解 ClawGym II 如何在不改写 OpenClaw 与 Claude Code 内部逻辑的前提下恢复 prefix tree、计算 PPO/GRPO rew…
从空白 scaffold 出发,如何让失败轨迹长成可复用的 agent harness:逐步拆解 function-level trace、failure window、held-out gate、真实 Repai…
Harness 为弱模型量身演化后,直接模仿强模型的完整轨迹会破坏二者的配合。本文沿着两条真实失败轨迹,拆解 on-policy correction 为什么只改学生自己的第一个错误 turn。
RIVER 先审计 instruction、Docker 与 verifier,从原有训练集留下约 3.5K 个可信环境,再用 repetition penalty 修正 turn-level advantage…
从真实 sepal_ui-814 case 出发,拆解 LEGO-RL 如何让 Claude Code、OpenHands 与 OpenCode 保留原生 control flow,同时把 token 对齐、MoE…
拆解 Harness-of-Harness 如何用固定的 Planner、Developer、QA Tester 和跨轮 evidence state,让 Codex 等现成 coding harness 连续开发…