这篇问得很尖锐:如果没有 reward,只靠 PI-conditioned teacher 的 dense token loss,模型真的学会正确性了吗?在较难的 QA、数学、代码和 agent tasks 上,答案通常是否定的。
Q1. PI-conditioned teacher 为什么会偏?
teacher 已经看过一条 reference solution,因此它的 next-token distribution 会把“沿着这条路写”当成高概率,而不是把所有正确替代路径都同等提高。论文把这称为 PI bias。
PI Bias Score 比较 teacher 相对 unprivileged student 对四种 target 的 log-probability advantage:reference solution、另一条 correct solution、incorrect solution、unrelated correct solution。观察到的顺序是 reference 远高于 alternative correct,后者只略好于 incorrect,并接近 unrelated correct。
Q2. 这篇反驳了哪些结论,又没有反驳什么?
| 结论 | 论文证据 |
|---|---|
| “dense SD loss 单独能教 correctness” | 在 harder tasks 上不成立 |
| “full reference PI 一定优于其他 context” | 不成立,reference-path bias 很强 |
| “所有 self-distillation 都无效” | 没有证明 |
| “reward + routing + local credit 也无效” | 没有测试 |
它的实验是故意拿掉 reward 的压力测试。阅读时不要把“lone objective 失败”误写成“OPSD 在任何组合里都失败”。
Q3. PI Bias Score 与训练设置怎么做?
Qwen3-8B think/instruct,补充 Qwen3-32B;MMLU-Pro、DAPO-Math、CodeForces、BFCL multi-turn。QA、math、code 各 2,000 items,BFCL 100 tasks。JSD clip 0.001,EMA 0.001,LR 多数 1e-5,code/agent 1e-6,batch 32,八 rollouts,三 epochs,response 16,384,8×B200。
诊断不只看 accuracy,还把 token 按 reference path、exploration、stopword、punctuation 和 style marker 分类。这使“loss 明明下降、任务却变差”的机制可被定位。
Q4. 负面结果具体有多严重?
| Setting | Validation change |
|---|---|
| OPSD · general QA think | −1.96 |
| OPSD · math think | −4.28 |
| OPSD · math instruct | −0.44 |
| ordinary SD · coding think | −0.30 |
| ordinary SD · agentic think | −3.51 |
正确 rollout 中,off-reference exploratory token 的 KL 约 0.31,on-reference token 只有 0.08。student entropy 上升、response 变短;更长 rollout、easy subset、32B scale 与 hint/skill-card PI 都没有修好。
loss 与 KL 对 correct/incorrect 的区分很弱,说明训练曲线下降不能当成 task learning 的证据。
Q5. 游戏论文必须增加什么实验?
构造一个 2×2 diagnostic:correct/incorrect × reference-near/reference-divergent。对每组测 teacher loss、KL、reward 和 update direction。最重要的一格是 correct + reference-divergent,它决定方法会不会压掉合法创新实现。
| 程序组 | 用途 |
|---|---|
| Correct + near | 确认 teacher 能利用 reference |
| Correct + divergent | 测 single-solution bias |
| Incorrect + near | 防止“像 reference 就高分” |
| Incorrect + divergent | 普通负例 |
再比较 reward-only、full-reference dense loss、state-gated loss 与 implicated-span loss。只报告最终 pass rate,会掩盖 method 是否靠 mode collapse 获益。
Q6. 证据和 artifact 有什么限制?
论文没有测试 reward 与 self-distillation 联合,主诊断又集中在一个 model family。它能否定“PI token matching 自身就是 correctness”,不能否定带 verifier 的 execution-grounded distillation。
paper 声称 code 在 supplementary,但公开 arXiv source tar 只有 TeX、bibliography/style 与 figures,没有 code archive 或 repository URL。兴趣程度 9.5/10;它应当成为你的 mandatory diagnostic,而不是 implementation base。
证据范围:本文阅读全文与附录,并分别检查 PDF 文本和逐页渲染;另检查公开 arXiv source tar,未发现论文所说的 supplementary code。兴趣程度 9.5/10 只表示博客作者对该方向的个人兴趣,不是通用论文评分。
留言