Meta-Harness: End-to-End Optimization of Model Harnesses
让 Claude Code 读取全部候选代码、分数与原始执行轨迹,再由独立外层程序验证和评测新 harness:本文拆解 Meta-Harness 的搜索闭环、三组实验、TerminalBench 真实迭代与证据边…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
让 Claude Code 读取全部候选代码、分数与原始执行轨迹,再由独立外层程序验证和评测新 harness:本文拆解 Meta-Harness 的搜索闭环、三组实验、TerminalBench 真实迭代与证据边…
固定模型、轨迹、reward 与更新次数,只改变 GRPO 的分组边界:这篇工作用四种 coding harness 和一个 held-out weak-ReAct,区分 source-configuration…
从一条真实 ClawGym-Bench 任务入手,拆解 ClawGym II 如何在不改写 OpenClaw 与 Claude Code 内部逻辑的前提下恢复 prefix tree、计算 PPO/GRPO rew…
从空白 scaffold 出发,如何让失败轨迹长成可复用的 agent harness:逐步拆解 function-level trace、failure window、held-out gate、真实 Repai…
Harness 为弱模型量身演化后,直接模仿强模型的完整轨迹会破坏二者的配合。本文沿着两条真实失败轨迹,拆解 on-policy correction 为什么只改学生自己的第一个错误 turn。
RIVER 先审计 instruction、Docker 与 verifier,从原有训练集留下约 3.5K 个可信环境,再用 repetition penalty 修正 turn-level advantage…
从真实 sepal_ui-814 case 出发,拆解 LEGO-RL 如何让 Claude Code、OpenHands 与 OpenCode 保留原生 control flow,同时把 token 对齐、MoE…
拆解 Harness-of-Harness 如何用固定的 Planner、Developer、QA Tester 和跨轮 evidence state,让 Codex 等现成 coding harness 连续开发…
拆解 Manage-Execute-Audit 如何用外置 task state、fresh-context executor 和只读 auditor 提升 Claude Code/Codex 的长任务可靠性,并追…
从三层 observability、change manifest 和真实失败轨迹出发,拆解 AHE 如何自动修改 prompt、tool、middleware 与 memory,以及它在 Terminal-Ben…