淡水鱼的蔚蓝之海

课程笔记、踩坑记录,还有一些摸鱼和日常。

复仇者不折镆干。虽有忮心,不怨飘瓦。
ChrisDing 的头像

最近写的

[2026-10-04] Self-Evaluating Recursive Agents

SERA 用强化学习训练同一个 Qwen3-4B 模型拆任务、执行和评价。关键对照是:只加评价训练不够,还要把学到的 rubric 用作子任务执行奖励。本文分开解释训练、普通评测和测试时选择,并对照代码说明运行框架…

搜文章