专用 harness 可以下线,
它教会模型的流程留下来
训练时,harnessing agent 把 h* 的指导逐步翻译成 h 中可执行的 response;部署时只保留 distilled student + minimal h。
每个领域维护一套最优 harness,部署复杂度会一直增长
只保留一套通用接口
部署简单,但丢掉领域流程、专用检查和工具带来的收益。
每个领域都带一套 h*
效果更好,却要继续维护路由、上下文、模型调用和版本兼容。
h、h*、K 不是三套同类 harness
htarget harness
student 实际运行的固定接口:一个 Bash execute 工具和固定 system prompt。
h*evolved student-side harness
tools、middleware、skills、memory,直接包住 student 时可以读状态、拦动作或增加工具。
Kprivate reference harness
把 h* 改写成 action recipes、review middleware、guidance 和 failure patterns。
所有 supervision 都先被翻译到目标 action space

h,移除 h*、K 与 harnessing agent。harnessing agent 只改下一步,然后把控制权还给 student
student 生成 y_t
这条 response 尚未进入 environment。
读取轨迹与 K
只能使用 student-visible evidence。
PASS / REPLACE
correction 必须是完整 response。
通过 h 运行
最多一个合法 execute。
结果写回轨迹
student 从新 observation 继续。
student 学的是自己做过的检查,不是 reviewer 的批语
进入 student-visible trajectory
- 任务与固定 system prompt
- accepted response
execute的输出和 exit code- 后续 student 可以据此修复
仅存在于 private review
K与 component 私有路径- 被拒绝的原 proposal
- PASS/REPLACE reason
- middleware 的触发提示
答案区域里的示例单元格,本身就是不能改写的规格
蓝色 B3/B4 是 worked examples;B5 被批量写入后改变了原值。
finish 时直接读取 sandbox,diff 输入与输出 workbook。
不读 sandbox,只检查轨迹里有没有 input–output comparison 的证据。
若 student 直接 finish,替换成普通 Bash/Python 验证命令。
命令输出进入可见轨迹,模型学会“验证后再提交”。
K 不替 student 偷读文件,而是生成 student 自己能执行的检查
# accepted response 中的 execute wb_in = openpyxl.load_workbook(INPUT) wb_out = openpyxl.load_workbook(OUTPUT) changed = [] for cell in answer_range: if input[cell].value is not None \ and input[cell].data_type != "f" \ and output[cell].value != input[cell].value: changed.append(cell) print("PASS" if not changed else changed) raise SystemExit(bool(changed))
同一个最小 h,三套领域轨迹
SpreadsheetBench
300 / 100train / held-out test;最终 487 条成功轨迹。
AppWorld
147 / 168train / test tasks;168 题组成 56 个 scenario;最终 282 条轨迹。
USPTO
500 / 100train / disjoint test;训练覆盖 10 个 reaction classes;保留全部 500 条轨迹。
同一个 evolved harness,经 agent 解释后平均更强
hh + empty reviewh*KK 只比 minimal h 高 0.6 分。增益来自 evolved guidance,不是“多一次模型调用”本身。蒸馏后的 9B 模型,在 minimal h 下达到 44.3%
| Setting | Spreadsheet | AppWorld | USPTO | Avg. |
|---|---|---|---|---|
Base + h | 31.0 | 26.8 | 12.0 | 23.3 |
Base + h* | 39.0 | 48.2 | 38.0 | 41.7 |
| Base + DeepAgents | 35.0 | 19.6 | 7.0 | 20.5 |
| Base + Claude Code | 31.0 | 10.7 | 6.0 | 15.9 |
| Harness-Zero + h | 44.0 | 58.9 | 30.0 | 44.3 |
Oracle 把采集成功率推到 98.6%,蒸馏后却只有 15.0%
| USPTO trajectory source | Collection | Test under h |
|---|---|---|
| Teacher rollout | 52.0 | 12.0 |
Teacher under h* | 62.0 | 3.0 |
Student under h* | 39.4 | 12.0 |
Empty K review | 44.2 | 11.0 |
| Oracle-answer review | 98.6 | 15.0 |
Harness-Zero K | 59.4 | 30.0 |
82.3% 表示在专门挑出的 support tasks 上恢复行为
h 为 0%、base + h* 为 100%;它不是自然分布上的总体行为准确率。Action-space 对齐是方法成立的前提,强 reviewer 与训练成本是代价
h* 的 38.0%。