01 · HARNESS-ZEROHarness Distillation via Agent-as-Harness

专用 harness 可以下线,
它教会模型的流程留下来

训练时,harnessing agent 把 h* 的指导逐步翻译成 h 中可执行的 response;部署时只保留 distilled student + minimal h。

23.3 → 44.3Qwen3.5-9B 三领域 macro average
82.3%28 种 harness-exclusive behavior 平均恢复率
Ye et al., arXiv:2609.24974v1
02 · MOTIVATION优化的是外部系统,收益也会留在外部系统

每个领域维护一套最优 harness,部署复杂度会一直增长

SHARED HARNESS

只保留一套通用接口

部署简单,但丢掉领域流程、专用检查和工具带来的收益。

↔
SPECIALIZED HARNESSES

每个领域都带一套 h*

效果更好,却要继续维护路由、上下文、模型调用和版本兼容。

论文 §1。
03 · NOTATION先分清谁在训练,谁在部署

h、h*、K 不是三套同类 harness

h

target harness

student 实际运行的固定接口:一个 Bash execute 工具和固定 system prompt。

训练与部署都保留
h*

evolved student-side harness

tools、middleware、skills、memory,直接包住 student 时可以读状态、拦动作或增加工具。

仅用于产生指导
K

private reference harness

把 h* 改写成 action recipes、review middleware、guidance 和 failure patterns。

仅供 harnessing agent 读取
论文 §3.1。
04 · ORIGINAL FIGURE 1Evolve → Review → SFT → Deploy

所有 supervision 都先被翻译到目标 action space

Harness-Zero 论文 Figure 1
作者官方 Figure 1。右下角明确标出:部署保留 h,移除 h*、K 与 harnessing agent。
官方仓库 assets/harness-zero.png,Apache-2.0。
05 · RESPONSE BOUNDARYreview 发生在 proposal 执行之前

harnessing agent 只改下一步,然后把控制权还给 student

1 · PROPOSE

student 生成 y_t

这条 response 尚未进入 environment。

2 · REVIEW

读取轨迹与 K

只能使用 student-visible evidence。

3 · DECIDE

PASS / REPLACE

correction 必须是完整 response。

4 · EXECUTE

通过 h 运行

最多一个合法 execute。

5 · OBSERVE

结果写回轨迹

student 从新 observation 继续。

PASS原 response 合理,不为风格或轻微低效而改写。
REPLACE用最小、连贯、可执行的 correction 修复关键流程。
论文 §3.2、Appendix C;官方 review.py。
06 · EVIDENCE BOUNDARYprivate review 不能泄漏进训练轨迹

student 学的是自己做过的检查,不是 reviewer 的批语

进入 student-visible trajectory

  • 任务与固定 system prompt
  • accepted response
  • execute 的输出和 exit code
  • 后续 student 可以据此修复

仅存在于 private review

  • K 与 component 私有路径
  • 被拒绝的原 proposal
  • PASS/REPLACE reason
  • middleware 的触发提示
论文 §3.2–3.3、Appendix C–D。
07 · WORKED EXAMPLEpreserving pre-filled cells

答案区域里的示例单元格,本身就是不能改写的规格

B
C
D
3
18
?
?
4
24
?
?
5
20 ✕
?
?

蓝色 B3/B4 是 worked examples;B5 被批量写入后改变了原值。

h* / MIDDLEWARE

finish 时直接读取 sandbox,diff 输入与输出 workbook。

K / REVIEW RULE

不读 sandbox,只检查轨迹里有没有 input–output comparison 的证据。

REPLACE

若 student 直接 finish,替换成普通 Bash/Python 验证命令。

SFT SIGNAL

命令输出进入可见轨迹,模型学会“验证后再提交”。

论文 Appendix B.2,Code 1–3。
08 · STUDENT-NATIVE ACTION根据 Code 1–3 压缩改写

K 不替 student 偷读文件,而是生成 student 自己能执行的检查

# accepted response 中的 execute
wb_in  = openpyxl.load_workbook(INPUT)
wb_out = openpyxl.load_workbook(OUTPUT)

changed = []
for cell in answer_range:
    if input[cell].value is not None \
       and input[cell].data_type != "f" \
       and output[cell].value != input[cell].value:
        changed.append(cell)

print("PASS" if not changed else changed)
raise SystemExit(bool(changed))
为什么能学命令、输出、修复都属于 student 的 action space 和 context。
为什么不是答案泄漏reviewer 不知道正确 workbook;它只要求执行可复用的 consistency check。
最终学到什么提交前比较输入与输出,并保护 pre-filled examples。
示意代码来自论文 Appendix B.2,不是额外 benchmark checker。
09 · DATA & TRAINING三个领域分别微调

同一个最小 h,三套领域轨迹

SpreadsheetBench

300 / 100

train / held-out test;最终 487 条成功轨迹。

AppWorld

147 / 168

train / test tasks;168 题组成 56 个 scenario;最终 282 条轨迹。

USPTO

500 / 100

train / disjoint test;训练覆盖 10 个 reaction classes;保留全部 500 条轨迹。

Qwen3.5-9BLoRA r=32, α=32batch 865,536 tokens2 epochsseed 42
论文 §4.1、Appendix D–E。
10 · TABLE 1 REDRAWNfrontier models,不做参数更新

同一个 evolved harness,经 agent 解释后平均更强

minimal h
68.6
h + empty review
69.2
code-as-harness h*
78.1
agent-as-harness K
81.1
空 K 只比 minimal h 高 0.6 分。增益来自 evolved guidance,不是“多一次模型调用”本身。
根据论文 Table 1 重绘;六个 benchmark–model setting 的平均百分比。
11 · TABLE 2 REDRAWN部署时移除 h*、K、harnessing agent

蒸馏后的 9B 模型,在 minimal h 下达到 44.3%

SettingSpreadsheetAppWorldUSPTOAvg.
Base + h31.026.812.023.3
Base + h*39.048.238.041.7
Base + DeepAgents35.019.67.020.5
Base + Claude Code31.010.76.015.9
Harness-Zero + h44.058.930.044.3
根据论文 Table 2 重绘;pass@1 / SGC,single run。
12 · TABLE 3 REDRAWNcollection success ≠ distillation value

Oracle 把采集成功率推到 98.6%,蒸馏后却只有 15.0%

USPTO trajectory sourceCollectionTest under h
Teacher rollout52.012.0
Teacher under h*62.03.0
Student under h*39.412.0
Empty K review44.211.0
Oracle-answer review98.615.0
Harness-Zero K59.430.0
根据论文 Table 3 重绘;同一 500-task split 与训练 recipe。
13 · TABLE 4 REDRAWN28 harness-exclusive patterns

82.3% 表示在专门挑出的 support tasks 上恢复行为

82.3%28 个 pattern 的平均 recovery
Protect pre-filled cells24/26 · 92%
Retrieve complete pages21/53 · 40%
Validate with RDKit60/60 · 100%
Choose action vs. answer24/33 · 73%
解读边界support set 按构造让 base + h 为 0%、base + h* 为 100%;它不是自然分布上的总体行为准确率。
根据论文 Table 4、Appendix G 重绘。
14 · TAKEAWAYS什么可以留下,什么暂时留不下

Action-space 对齐是方法成立的前提,强 reviewer 与训练成本是代价

WHAT WORKS程序化流程inspection、verification、recovery 容易通过 response 示范并由 SFT 吸收。
WHAT LAGS深领域知识USPTO:distilled 30.0%,仍低于 h* 的 38.0%。
REVIEWER弱模型会改坏Qwen3.6-35B-A3B 上 agent-as-harness 比 code-as-harness 低 12 分。
COLLECTION COST100.1s → 237.2sUSPTO 平均延迟约 2.4×;部署阶段不再支付。
核心问题 1 / 14