LongHorizon-Harness:把长任务变成可审计的状态推进
拆解 Manage-Execute-Audit 如何用外置 task state、fresh-context executor 和只读 auditor 提升 Claude Code/Codex 的长任务可靠性,并追…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
拆解 Manage-Execute-Audit 如何用外置 task state、fresh-context executor 和只读 auditor 提升 Claude Code/Codex 的长任务可靠性,并追…
从三层 observability、change manifest 和真实失败轨迹出发,拆解 AHE 如何自动修改 prompt、tool、middleware 与 memory,以及它在 Terminal-Ben…
用 h、h*、K 三个对象和一个真实 SpreadsheetBench 案例,讲清 Harness-Zero 如何把专用 agent harness 的行为转成可在最小工具接口下学习的训练轨迹。
从 Godot 的场景树与物理帧讲起,拆解 GameLogicBench 如何用 72 个任务、403 个手工场景、1,451 个测试用例和逐帧断言评测游戏逻辑。
从预先定稿的评测规则、Armor Alley 真实断言和两类失败样例,拆解 GameASG-Bench 如何验收 47 个浏览器游戏任务。
一份关于 Jev、NanoJev、BERT 与 LLM 的 17 页交互图解。
Docker 没搞定,手动装也重来了几遍。最后能进服了,第二天又连不上。
南软面试刚结束,用驱动云送的计算点折腾了一下 FaceFusion。
非背诵速通版,只是尽力把课上的几条线理清楚。
起床看了个好玩的,顺手把博客 RSS 也配了。