79.7
Math OPCD
53.9
Sokoban filtered experience
50 updates
主训练长度
8.5/10
个人兴趣
OPCD 让 student 无 context rollout,再由 context-conditioned teacher 重评同一轨迹。
Math OPCD
Sokoban filtered experience
主训练长度
个人兴趣
失败、重复与环境噪声全部保留
模型总结可迁移的规则
只保留对当前任务有帮助的经验
student 无 experience
固定 response tokens
teacher prompt 加 experience
同 tokens 再算 log-prob
student || teacher
代码可只保留 student 概率最高 256 个 vocabulary entries;除非 retained mass 接近 1,否则不等于 full KL。
Sokoban 53.9
Sokoban 18.8
保留真实试错,但 token 极长
删除已证伪分支
便于检索,可能丢掉关键状态
veRL fork、环境、experience pipeline
text-game 经验需 online stage 生成
成功轨迹是否有用,取决于它怎样被压缩、过滤并对齐到 student 当前状态;“更多历史”不是单调增益。