01 · PAPER IN ONE PAGEYu et al. · arXiv:2609.09134v1

不要照抄 expert 的整条轨迹:只修 student 自己的第一个错误 turn

为弱模型演化出 h* 后,完整 imitation 把 Qwen 从 78.0% 拉到 63.1%;single-turn on-policy correction 保住 planning fit,并达到 79.7%。

论文检查训练数据是否来自 student 部署时真正会访问到的 states,而不是只比较 teacher 的能力。

29.2→78.0Harness evolution
78.0→63.1Full imitation
78.0→79.7On-policy correction
9.7/10博客作者个人兴趣程度
来源:论文 Abstract、Table 1、Appendix B-D。
02 · PART 0student · expert · evolved harness · verifier

先把四个 actor 分开,才能看懂“谁在给谁造数据”

STUDENT

Qwen3-Coder

产生 harness-evolution rollout,也是 LoRA-SFT 的对象。

EXPERT

Gemini 3.1 Pro

提出 harness edit,生成完整 trajectory 或单 turn correction。

H*

Evolved harness

Prompt、tools、hooks 与 context 围绕 Qwen 的失败轨迹演化。

VERIFIER

Binary success

Task rollout 通过记 1,否则记 0;test split 保持 held out。

来源:论文 §3.1、Appendix A-B。
03 · MOTIVATIONstrong teacher ≠ safe training distribution

Expert 能把 h* 用到 93.6%,却不代表 student 能复制它的 plan

EVOLVE29.2→78.0h* 围绕 Qwen 的 native planning 修 prompt、tool 与 hook。
TRANSFER UP93.6Gemini expert 也能使用同一 h*,显示 model-side headroom。
IMITATE63.1Qwen 学整条 expert trajectory,七项 task 全退。
DIAGNOSE14.6%Planning failures 从 1.1% 跳到 14.6%。
CORRECT79.7只改 student rollout 中一个错误 turn。
来源:论文 Table 1、Table 3。
04 · CONCEPTthe runtime is fitted to a behavior distribution

同一段 harness code,对不同 planning cadence 不是同一个系统

NATIVE STUDENT PLAN

h* 期待的节奏

  • 按 scaffold 拆分 subtask
  • 在指定位置调用 tool / hook
  • 一次 verify 后 finish
  • 遇错按 Qwen 常见方式恢复
⇄
IMITATED EXPERT PLAN

能力没有同步迁移

  • 更短、更早作答
  • 跳过 h* 依赖的中间步骤
  • 或把一次检查扩成循环
  • 知识增加,task success 仍下降
来源:论文 §3.3.3、Appendix D。Planning-fit 是作者的机制解释。
05 · RELATED WORKwhat remains at deployment?

这篇论文保留 evolved harness;它不是 harness removal 或跨接口迁移

路线优化对象部署产物与本文的区别
Meta-Harness / Better HarnessesHarness codeModel + evolved harness不做 weight update。
Co-Harness / WHALE / HarnessForgeHarness + weightsMatched pair联合增益;本文隔离 imitation regression。
On-policy correctionStudent-visited statesModel + fixed interface本文加入 model-specific h* 的 compatibility 问题。
Harness-ZeroCross-interface behavior transferModel + minimal target harness移除 source harness;本文不移除 h*。
Grow the HarnessExecutable control codeModel + specialist harness把重复策略留在代码,不做 model correction。
来源:论文 §2;Harness-Zero 与 Grow the Harness 的边界由本文按部署产物整理。
06 · ORIGINAL FIGUREFigure 1 · CC0 1.0

作者把 co-evolution 拆成 harness update 与 compatibility-preserving model update

Harness-model co-evolution
原论文 Figure 1,依据 arXiv 页面标明的 CC0 1.0 直接引用。
07 · TASK PROVENANCEinherited from Yang et al. (2026)

七类 enterprise tasks 共用客观 verifier,但本文没有重新发布 task package

DATA

Attendance + Budget

Payroll auditing 与审批协议;依赖聚合规则和受控数据访问。

MONITORING

Stock + Anomaly

枚举低库存项;完成 query-detect-report-upload workflow。

BROWSER

Playwright + Website

浏览器自动化与 Magento Admin;需要 structured finish。

CODE

Refactor

代码重构;winning harness 增加 global search tool。

来源:论文 §3.1、Appendix A。本文未披露逐 split task 数和 checker code。
08 · HARNESS EVOLUTION3 seeds · $20/task · 600 s/rollout

每个任务单独演化;validation 变好才保留 edit

01 · EXECUTEQwen rollout在当前 harness 上跑 task minibatch。
02 · OBSERVETrace + errorVerifier feedback 与 tool-call errors 可见。
03 · PROPOSEGemini edit改 system prompt,也可增删 tools / hooks。
04 · VALIDATEPareto poolMinibatch performance 上升才保留。
05 · SELECTBest h*最高 validation score;同分取较早 iteration。
来源:论文 Appendix A。Test split 不参与选择。
09 · SFT-IMITATIONexpert states + student successes

完整 imitation 把 expert 的知识与 planning path 一起复制

COLLECTreward=1先收集 Gemini 在 h* 下的成功 trajectories。
MIXself-pass加入 Qwen 自己在 h* 下的 passing rollouts。
CONVERTchat/tools转成 Qwen input 与 tool-call format。
LORA-SFT2 epochsrank 16/64,lr 1e-4,bf16,batch 8。
TEST63.1三 LoRA seeds 平均;七项 task 全部下降。
来源:论文 §3.3、Appendix B。Sequence length 49,152 或 98,304。
10 · SFT-CORRECTIONstudent states + one expert rewrite

保留 student 的整条轨迹,只替换定位出的失败 turn

01 · ROLLOUTStudent failsQwen 在 h* 下访问真实部署 states。
02 · LOCALIZEFirst wrong turn自动化 step 根据 failed checkpoint 定位。
03 · REWRITEExpert ×3一句 corrected strategy + corrected tool call。
04 · SELECTQuality judge三个候选留下一个,前后 turns 不改。
05 · SFT≈500 rows≈400 correction + ≈50 self-pass,得到 79.7。
来源:论文 §3.4、Appendix B。约数未完全相加到 500,论文没有解释差额。
11 · PSEUDOCODEarticle reconstruction · not official code

每条训练数据都是 student 轨迹中的一个局部补丁

# Based on Appendix B; names are explanatory.
def make_example(student_rollout, failed_checkpoint):
    turn = localizer.first_wrong_turn(
        rollout=student_rollout,
        checkpoint=failed_checkpoint,
    )
    candidates = [
        expert.rewrite_only_this_turn(
            task=student_rollout.task,
            prefix=student_rollout.before(turn),
            failed_checkpoint=failed_checkpoint,
        )
        for _ in range(3)
    ]
    patch = quality_judge.select_best(candidates)
    return student_rollout.replace(turn, patch)
论文未公开训练 repo、prompt、quality judge 或 correction rows;此页只重建公开协议。
12 · REAL FAILUREAppendix D · Qwen payroll audit

答案已经算对,却在重复检查中耗尽 78 steps

H* RECIPE算 → 验 → 交Employee aggregation、mean-of-means、rounding、verify once。
BASE QWEN14-20同一 example 三条 rollout 都在 14 到 20 steps 得 1.0。
AFTER SFT答案正确Scorer 记录正确 department aggregates。
LOOP29 + ≈20同一 view 29 次,prompt 约重读 20 次。
NO FINISH78 → 0始终没有提交,binary task success 为 0。
来源:论文 Appendix D, Case 1。作者提供叙述,没有发布原始逐 turn log。
13 · REAL FAILUREAppendix D · Gemma review count

目标是 Approved=346,模型却把未筛选总数 351 提前交了

Two imitation planning failures
Harness contract定位 status column → filter Approved → read filtered total → structured finish。
Base Gemma执行 filter-then-count,返回 truth 346。
SFT-imitation Gemma进入 grid 后直接读取 “351 records found”,跳过筛选并提前 finish。
来源:论文 Appendix D, Case 2。
14 · MAIN RESULTS7 tasks · 3 runs · mean ± SEM

最大的提升来自 h*;correction 的作用是保住它,而不是追平 expert

Main task success results
根据论文 Table 1 重绘。Avg 为七项算术平均。
15 · TASK-LEVEL DELTASrelative to Qwen + h*

Full imitation 七项全退;correction 五项上升、两项接近持平

Task-level deltas
根据论文 Table 1 重绘。论文没有逐任务显著性检验。
16 · MECHANISM EVIDENCELLM-classified hard failures

Imitation 增加 recipe adoption,也同时制造新的 planning failures

Planning and knowledge failure composition
Knowledge movedDomain recipe adoption 30.8% → 76.1%;knowledge failure 46.2% → 44.5%。
Planning brokePlanning failure 1.1% → 14.6%;correction 仅为 1.8%。
Failure labels 来自未公开配置的 LLM judge,不是人工 gold labels。
来源:论文 Tables 2-3、Appendix C。
17 · EVIDENCE BOUNDARYwhat remains unverified

负结果可信度较强,local correction 的可复现性仍有限

NO RELEASE

训练 artifacts

没有官方 repo、task files、≈500-row correction set、checkpoint 或原始 logs。

JUDGE GAP

Failure taxonomy

未披露 classifier identity、prompt、人工 agreement 或 confusion matrix。

SMALL NET GAIN

+1.7 points

Correction 的强证据是避免 −14.9 回退,不是大幅超过 h* baseline。

ONE UPDATE

Co-evolution

Figure 1 画多轮循环,实验主要验证一次 harness update 后的一次 SFT。

核查日期:2026-09-29。arXiv 页面标注 CC0 1.0。
18 · TAKEAWAYSfor Claude Code / Codex harness research

训练数据要尊重 learner 的 state distribution,也要重新验证旧 harness 的兼容性

WHAT SURVIVES

一条清楚的设计规则

在 student 自己访问到的失败 state 上做局部 correction;不要默认成功 expert trajectory 是安全的训练单位。Model 版本变化后,对 prompt、tool、hook 与 finish behavior 做 compatibility regression。

WHAT TO TEST NEXT

完整 coding harness 实验

同一批 sealed repo tasks 上比较 full imitation、single-turn correction 与 short-window correction;人工复核 first-failure localization,并把补丁放回真实环境重新执行。

个人兴趣度 9.7/10。高分表示与完整 harness 研究高度相关,不是论文绝对质量排名。
核心结论1 / 18