HarnessFix 先把 raw trace 编译成带数据流、控制流和代码锚点的 HTIR,再做归因、生成 scoped patch 与回归验证。本文复盘真实 AppWorld case、四 benchmark 结果、跨模型迁移和诊断数据的可复现性边界。
Q1. 为什么 final reward 不足以指导 harness 修复?
因为“任务失败”只告诉你终点错了,没有告诉你证据在哪一步丢失、哪段 runtime logic 允许了错误完成。Agent 轨迹混合 model call、tool result、state change 与 orchestrator 决策;直接把整条 trace 丢给 editor,容易得到大而泛的 patch。
作者先分析 30 个开源 Agent、约 57,780 条 issue / PR / commit / release record,经 LLM 分类与人工抽查得到 26,174 条 harness-related 记录,占 45.3%。缺陷跨越 ETCLOVG 七层,而不只是 prompt。
Q2. HarnessFix 与 prompt optimization、Self-Harness 的差别是什么?
HarnessFix 的重点不是搜索更多版本,而是先把 failure evidence 对齐到实现机制。GEPA 主要改 prompt;Self-Harness 从 failure signature 直接提出最小 edit;HarnessFix 增加一层 HTIR,让诊断 agent 能指出 responsible step、implementation anchor、harness layer 和 repair operator。
Q3. HTIR 如何把失败轨迹定位到具体代码?
流水线由四个 Agent 组成:trace abstraction、diagnosis、repair、validation。TraceStep 记录行为角色、执行状态与可观察 artifact/state effect;data-flow link 追踪证据如何被复制、概括或丢失;control-flow link 解释为何继续、重试或完成。诊断被合并成 recurring flaw record,再映射到七层 repair operators。
AppWorld 的 completion-guard 例子
支付 API 返回“调用成功”,但缺少必填 user_email,外部状态没有变化。旧 guard 只看 status=success,随后调用 complete_task()。HTIR 把 API 文档到错误 request 的数据流、以及 success 到 premature finalize 的控制流连起来;修复要求完成前检查真实 state effect,而不是改一句泛化提示。
Q4. 四个 benchmark 的提升来自哪些修复?
固定 GPT-5 mini 时,HarnessFix 在 GAIA、SWE、AppWorld、Terminal-Bench 2.0 分别把初始 harness 从 43.3→61.7、45.3→57.3、36.7→43.0、17.6→26.5。它比 human-designed harness 平均高 6.3 pp,比自动 baseline 平均高 6.9 pp;相对 Meta-Harness 高 2.6–5.0 pp,同时后者多用 63.5%–100.5% offline tokens。
HTIR 对人工 gold 的 step accuracy 85.0%、implementation anchor 81.3%、layer macro-F1 86.2%、repair operator 82.5%。GAIA 上从 GPT-5 mini 生成的修复迁移到 Sonnet、DeepSeek、Qwen、Gemini,增益为 +5.5 到 +9.5 pp。
论文对重复运行做 one-sided paired sign test,p 值 2.4×10⁻⁴ 到 4.9×10⁻⁴;这支持“在当前 protocol 内有一致提升”,不等于对未知 benchmark 的普遍保证。
Q5. 这套诊断链还需要怎样的独立验证?
下一步要公开 motivational-study 的完整标注协议和 task-level repair traces,并让独立 annotator 复核 HTIR gold。论文说详细收集与分类过程在网站,但公开材料仍不足以逐条重建 57,780→26,174 的筛选链。LLM-assisted taxonomy 也可能把作者自己的修复语言写回 gold。
官方仓库 commit 9167a0b9… 已核验;应进一步固定依赖、benchmark task ids、raw traces、失败 patch 与 regression suite,使“诊断准确”与“最终分数提高”都能独立复跑。
Q6. 最后怎样评价 HarnessFix?
HarnessFix 把 harness repair 从黑盒 hill-climbing 推向可解释的软件诊断。最有价值的不是多 Agent 数量,而是 state effect 与 implementation anchor:它迫使系统说明“哪个运行事实对应哪段可改代码”。
主要来源:论文全文与附录、arXiv v1 元数据;代码或项目页于 2026-10-08 核验。固定来源状态:9167a0b9a58748c73b56c3ee04fdc3437ba0c56e。
留言