01 · QUESTIONarXiv:2602.12275 · 2026-02-12

怎样把 agent 历史变成无需携带的模型能力?

OPCD 让 student 无 context rollout,再由 context-conditioned teacher 重评同一轨迹。

79.7

Math OPCD

53.9

Sokoban filtered experience

50 updates

主训练长度

8.5/10

个人兴趣

来源:Abstract;Tables 1-31 / 9
02 · EXPERIENCEarXiv:2602.12275 · 2026-02-12

一段历史不等于一条可用经验

Raw trace

失败、重复与环境噪声全部保留

Consolidated

模型总结可迁移的规则

Filtered

只保留对当前任务有帮助的经验

来源:Section 3;experience ablation2 / 9
03 · PROTOCOLarXiv:2602.12275 · 2026-02-12

response token 只生成一次,prompt 重建两次

1Rollout

student 无 experience

2Save

固定 response tokens

3Rebuild

teacher prompt 加 experience

4Rescore

同 tokens 再算 log-prob

5Reverse KL

student || teacher

来源:Algorithm 1;官方 opcd code3 / 9
04 · LOSSarXiv:2602.12275 · 2026-02-12

Top-256 是近似,不是完整词表 KL

Σ p_student · (log p_student − log p_teacher)

代码可只保留 student 概率最高 256 个 vocabulary entries;除非 retained mass 接近 1,否则不等于 full KL。

来源:官方代码 6f53ef4…4 / 9
05 · NEGATIVE RESULTarXiv:2602.12275 · 2026-02-12

Raw trace 让数学 validation 变差

Base
75.1
Raw traces
70.5
Summarized context
77.4
OPCD
79.7
根据 ablation table 重绘5 / 9
06 · TEXT GAMEarXiv:2602.12275 · 2026-02-12

固定 teacher 比持续自更新稳定得多

Fixed split

Sokoban 53.9

Continual self-distill

Sokoban 18.8

来源:text-game experiments6 / 9
07 · GAME CODEarXiv:2602.12275 · 2026-02-12

把 build log、filtered trace 与 lesson 分开测

完整日志

保留真实试错,但 token 极长

筛选轨迹

删除已证伪分支

跨任务 lesson

便于检索,可能丢掉关键状态

本文实验设计建议7 / 9
08 · CODEarXiv:2602.12275 · 2026-02-12

LMOps 实现完整,复现成本也高

公开

veRL fork、环境、experience pipeline

注意

text-game 经验需 online stage 生成

代码审计:6f53ef41c951de0962bbf27fe3f5819eabc8ce0e8 / 9
09 · VERDICTarXiv:2602.12275 · 2026-02-12

经验先提炼,再谈 distillation

成功轨迹是否有用,取决于它怎样被压缩、过滤并对齐到 student 当前状态;“更多历史”不是单调增益。

兴趣程度 8.5/109 / 9