[2026-09-03] EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness?
EvoHarnessBench 不是让 Agent 写 harness,而是把 tools、skills、specialist agents 分阶段扩张,测试部署退化、持久适应、forward transfer 与…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
EvoHarnessBench 不是让 Agent 写 harness,而是把 tools、skills、specialist agents 分阶段扩张,测试部署退化、持久适应、forward transfer 与…
Evo-Bench 专门测试模型作为长时程 harness evolver 的能力:固定 DeepSeek policy,给 20 次迭代、1,000 steps 和 48 小时,观察九个模型能否稳定改进同一 Co…
Meta-Agent Challenge 不让模型直接答题,而是给它 12–24 小时写一个 task-specific agent.py。本文拆解双容器、五领域、隐藏 test、39 组配置、高方差与 591 个…
VeRO 用 Git worktree、预算、隔离执行、实验数据库与结构化 trace 构建“优化 harness 的外层 harness”。本文拆解五种抽象、120 个实验、TerminalBench failu…
HarnessFix 先把 raw trace 编译成带数据流、控制流和代码锚点的 HTIR,再做归因、生成 scoped patch 与回归验证。本文复盘真实 AppWorld case、四 benchmark…
Self-Harness 让同一个固定模型既执行任务,也从失败中提出并验证自己的 harness 修改。本文拆解 weakness mining、最小编辑、双 split promotion gate、九组结果,以…
Harness-R1 把 harness 修补训练成一个 9B 模型的专门能力:从 failure packet 生成 lifecycle-wide patch,再用冻结 target agent 的真实重跑收益做…
HarnessOpt-Bench 用固定 seed、target model、环境、verifier 和严格 dev/val/test 边界,把“优化 agent harness”变成可比较实验。本文拆解预算、no…
HarnessDev 把评测对象从任务答案换成可运行的 harness:六个模型从弱 seed 创建完整执行系统,再用下游反馈继续演化。本文拆解任务边界、隐藏评测、执行器迁移、真实失败与 2,207 个实例上的结果。
Video2World 如何把单段具身视频变成可执行模拟器重建任务:逐项拆解 222 个实例的来源、Agent 可见边界、submission package、物理执行、task judge、V2WScore、真实…