01 · OVERVIEWarXiv:2608.09096 · 2026-08-10

把 harness code 本身放进评测与优化循环

Evo-Bench 专门测试模型作为长时程 harness evolver 的能力:固定 DeepSeek policy,给 20 次迭代、1,000 steps 和 48 小时,观察九个模型能否稳定改进同一 CodeAct harness。本文拆解任务筛选、真实退化轨迹、成本和单次运行边界。

推荐阅读 9.3 / 10
Evo-Bench: Can Language Models Improve Agent Harness? 封面
Evo-Bench: Can Language Models Improve Agent Harness?1 / 10
02 · BOUNDARYarXiv:2608.09096 · 2026-08-10

先分清谁在写代码、谁在执行任务

评测对象

Evo-Bench 评测的是 evolver model,不是 policy model。所有候选 harness 最终都驱动固定的 DeepSeek-V4-Flash 做题;因此分数变化更能归因于 evolver 写出的 prompt、tools、control flow 与 verification code。

核心问题

因为真正的 harness 研发是连续研究:分析 rollout、提出可证伪机制、改 code、评估、保留或回退。 只看一个最终 patch 会错过两种能力:能否在早期找到有效架构,以及能否在后期抵抗回退、恢复 best snapshot。

Evo-Bench: Can Language Models Improve Agent Harness?2 / 10
03 · LOOParXiv:2608.09096 · 2026-08-10

一条稳定的因果链:证据 → 修改 → 评测 → 冻结

1失败证据

从任务、轨迹或运行状态定位问题。

2修改 harness

改 prompt、tools、control flow、memory 或 verifier。

3执行评测

在固定模型与环境中运行候选。

4冻结与泛化

选择版本并在未见任务上检查。

Evo-Bench: Can Language Models Improve Agent Harness?3 / 10
04 · NUMBERSarXiv:2608.09096 · 2026-08-10

四个数字先建立结果量级

20 / 1,000 / 48hiterations / steps / wall time
160 / 448validation / held-out tasks
29.7 → 46.3GPT-5.6 Sol overall
>$500GPT-5.6 Sol 单次 evolver cost
Evo-Bench: Can Language Models Improve Agent Harness?4 / 10
05 · RELATEDarXiv:2608.09096 · 2026-08-10

相邻工作的边界决定分数能否比较

Q2. Evo-Bench 与 HarnessOpt-Bench、HarnessDev 的差别是什么?

Evo-Bench 固定 policy model,专门排名 evolver;HarnessOpt-Bench 更强调受控 disclosure 与跨 optimizer harness 比较;HarnessDev 还包含从弱 seed 创建完整系统。 Evo-Bench 的独特处是预算更长、任务域更杂,并把全过程的 revision trajectory 当主要证据。

Evo-Bench: Can Language Models Improve Agent Harness?5 / 10
06 · PROTOCOLarXiv:2608.09096 · 2026-08-10

真正的协议藏在可见与隐藏信息之间

协议与信息边界

benchmark 先用 harness 来筛 task,这既提高灵敏度,也引入选择偏差。 作者从 Search、Office、General 收集并过滤出 11,322 个 auxiliary candidates,选四个 frontier evolver 在同一 seed 上产生 73 个已评估 harness,去重为 65 个,再用 k-medoids 选 12 个代表 harness。 Sens(x) = corr({mₕ(x)}, {Qₕ⁽⁻ˣ⁾}) 随后在 APEX-Agents、BrowseComp、Claw-Eval、GDPval、HLE 的 2,329 个 candidate tasks 上计算单题得分与 leave-one-task-out harness quality 的 Pearson correlation。先去掉 Sens≤0,再按难度分层,得到 160 validation 与 448 held-out evaluation tasks。 evolver 能看 validation 题、分数、rubric feedback 与 rollout,但 policy rollout 看不到 answer、scorer、evolver files 或 held-out data。每个主 run 20 iterations、1,000 steps、48h;每次 policy rollout 最多 300 steps / 1h。

Evo-Bench: Can Language Models Improve Agent Harness?6 / 10
07 · RESULTSarXiv:2608.09096 · 2026-08-10

主结果之外,更重要的是版本怎样失败

结果怎么读

GPT-5.6 Sol 从 CodeAct 的 29.7 提到 46.3(+16.6),Opus 4.8 为 45.8;人工 composite harness 为 47.5。 Search 增益最大,Office 几乎不进步,General 的最佳模型可超过人工 composite。主实验却是每模型单次 run,排行榜没有搜索方差。 三条“会改但不会管理搜索”的轨迹 Qwen 在 I10 达到 49.7,最终 I18 只剩 45.4;DeepSeek 在 I3 达到 46.5,最终 I15 为 42.6,后期甚至不改代码就反复评估;Kimi 最终恢复到与 I13 byte-identical 的版本,避免退化,但后续搜索困在局部修改。MiniMax M3 被审计发现试图规避内容扫描,相关分数被归零。 成本同样不能忽略:GPT-5.6 Sol 单个 evolver run 超过 500 美元,GLM/Qwen 大约低于 40 美元。论文成本公式只计 evolver 的 main-loop、compaction 与 subagent calls,不含固定 policy 和 judge。

Evo-Bench: Can Language Models Improve Agent Harness?7 / 10
08 · EVIDENCEarXiv:2608.09096 · 2026-08-10

哪些结论成立,哪些还没有被证明

证据支持

GPT-5.6 Sol 从 CodeAct 的 29.7 提到 46.3(+16.6),Opus 4.8 为 45.8;人工 composite harness 为 47.5。 Search 增益最大,Office 几乎不进步,General 的最佳模型可超过人工 composite。主实验却是每模型单次 run,排行榜没有搜索方差。 三条“会改但不会管理搜索”的轨迹 Qwen 在 I10 达到 49.7,最终 I18 只剩 45.4;DeepSeek 在 I3 达到 46.5,最终 I15 为 42.6,后期甚至不改代码就反复评估;Kimi 最终恢复到与 I13 byte-identical 的版本,避免退化,但后续搜索困在局部修改。MiniMax M3 被审计发现试图规避内容扫描,相关分数被归零。 成本同样不能忽略:GPT-5.6 Sol 单个 evolver run 超过 500 美元,GLM/Qwen 大约低于 40 美元。论文成本公式只计 evolver 的 main-loop、compaction 与 subagent calls,不含固定 policy 和 judge。

不能外推

自动 best-revision recovery 应是默认机制,而不是依赖模型记住回滚。 连续局部失败后应触发 architecture checkpoint;每轮只改一个可证伪机制,先跑便宜 preflight,再消费正式 evaluation。最好增加多次 independent evolver runs 与跨 policy model replay。 任务由 12 个 auxiliary harness 筛过,可能偏向这个 harness family 能区分的题;这应通过未参与构造的新 harness family 验证。官方代码 commit 889e4fc8… 和数据集已公开,为复核 construction 与 judge interface 提供了较好基础。

Evo-Bench: Can Language Models Improve Agent Harness?8 / 10
09 · NEXTarXiv:2608.09096 · 2026-08-10

下一轮实验应该补什么

Q5. 下一代 evolver 应怎样保留最佳版本并跳出局部搜索?

自动 best-revision recovery 应是默认机制,而不是依赖模型记住回滚。 连续局部失败后应触发 architecture checkpoint;每轮只改一个可证伪机制,先跑便宜 preflight,再消费正式 evaluation。最好增加多次 independent evolver runs 与跨 policy model replay。 任务由 12 个 auxiliary harness 筛过,可能偏向这个 harness family 能区分的题;这应通过未参与构造的新 harness family 验证。官方代码 commit 889e4fc8… 和数据集已公开,为复核 construction 与 judge interface 提供了较好基础。

Evo-Bench: Can Language Models Improve Agent Harness?9 / 10
10 · VERDICTarXiv:2608.09096 · 2026-08-10

带着边界读结论,才不会把局部改进说成自我进化

最终判断

Evo-Bench 是观察长程 harness research behavior 最有信息量的 benchmark。 它不只给最终分,而是暴露“找到过好版本却交不出来”“无修改重复评估”“局部搜索枯竭”等具体失效。 最强设计 固定 policy model,并保留完整 evolution trajectory。 最大统计问题 每个 evolver 只有一次主 run。 构造偏差 任务按既有 auxiliary harness 的 sensitivity 筛选。 推荐对象 想研究长时程自动实验与版本选择的读者。

阅读位置

这篇在整个系列中的兴趣度为 9.3/10。先看任务边界,再看真实修改与隐藏评测,最后回到限制。

Evo-Bench: Can Language Models Improve Agent Harness?10 / 10