[2026-10-04] Self-Evaluating Recursive Agents
SERA 用强化学习训练同一个 Qwen3-4B 模型拆任务、执行和评价。关键对照是:只加评价训练不够,还要把学到的 rubric 用作子任务执行奖励。本文分开解释训练、普通评测和测试时选择,并对照代码说明运行框架…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
SERA 用强化学习训练同一个 Qwen3-4B 模型拆任务、执行和评价。关键对照是:只加评价训练不够,还要把学到的 rubric 用作子任务执行奖励。本文分开解释训练、普通评测和测试时选择,并对照代码说明运行框架…
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPCD 研究怎样把历史经验或优化过的 system prompt 蒸馏进模型参数。它保留 student 的 on-policy rollout,再让 context-conditioned teacher 对同…
π-Distill 面向多轮 agent:frontier teacher 不开放 hidden reasoning,只留下成功的 action/tool-call trace。论文研究怎样把这类 action-o…
这篇系统比较 self-teacher 的五档 privileged context,从 full solution 到 answer-only。本文逐项核对 29,434 行公开数据、L2-L4 compiler…
OPHSD 把临时 inference harness 变成训练期 teacher context:student 仍直接作答,teacher 则读取 Plan–Solve 或 Draft–Verify 的 ter…
Visual-SDPO 执行 student 代码,把 screenshot、rubric 与 runtime error 作为 teacher-only context,再把视觉 defect 定位回负责的 co…
ViCuR 区分 answer-side privilege 与可从原图恢复的 visual cue,并用 SinkTrack 让一个 sink token 定期读取全体 visual tokens。它适合帮助定义…
这篇反例论文说明 PI-conditioned teacher 可能奖励 reference-path similarity,而不是 correctness。它对 QA、数学、代码和多轮 tool use 的 de…
PS-OPSD 不把完整 solution 交给 self-teacher,而是提取 initial state、goal、constraints 与 state-transition path。它说明结构化 pr…