43.4
Qwen3-1.7B OPSD 平均分
1 rollout
每题一个 student trajectory
1,024 tokens
主实验 completion 上限
9/10
个人兴趣程度
OPSD 只改变训练期上下文:student 看 question,frozen self-teacher 多看 verified solution。
Qwen3-1.7B OPSD 平均分
每题一个 student trajectory
主实验 completion 上限
个人兴趣程度
question → 采样 y;部署时也只有 question
question + reference solution + 同一个 y<t;只负责打分
teacher 不替换 student trajectory,因此训练覆盖的是当前 policy 真正访问到的状态。
student 只看 question
加入 reference context
teacher 评估相同 tokens
full-vocabulary forward KL
只更新 student LoRA
逐 vocabulary component 截断后再求和,可能破坏完整 KL 的非负性。复现必须写清。
| 配置 | OPSD | GRPO |
|---|---|---|
| rollouts / problem | 1 | 8 |
| max output | 1,024 | 16,384 |
| updates | 100 | 500 |
| trainable params | LoRA | LoRA |
常见题目只有一个标准终点,但推理路径仍可多样
scene tree、API 和控制流可以完全不同
compile、hidden tests、gameplay 与 visual verifier
trainer、collator、launch 与 evaluation scripts
commit、template、fixed/EMA teacher、loss estimator、clip
固定 student rollout 和 verifier,只扫 context family
证明 context、routing 与 span credit 怎样影响正确替代实现