论文解读·

[2026-08-05] Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation

这篇反例论文说明 PI-conditioned teacher 可能奖励 reference-path similarity,而不是 correctness。它对 QA、数学、代码和多轮 tool use 的 dense self-distillation 做压力测试,是游戏多解程序必须读的失败诊…

页数
9
形式
交互图解
更新
2026.10.08
文章目录

Sarthak Harne, Chinmay Karkar, Yash Pandya, et al. · arXiv:2608.04794v1 · 最早公开于 2026-08-05

9 页交互图解 · 先看训练链、真实 case 与复现边界大屏阅读 ↗

使用按钮或 ← → 翻页,F 进入或退出全屏按 Esc 退出全屏;独立打开后可返回文章

这篇问得很尖锐:如果没有 reward,只靠 PI-conditioned teacher 的 dense token loss,模型真的学会正确性了吗?在较难的 QA、数学、代码和 agent tasks 上,答案通常是否定的。

0.31 vs 0.08off-path / on-path KL
−4.28math think,OPSD change
4 类PI Bias Score targets
9.5/10个人兴趣程度

Q1. PI-conditioned teacher 为什么会偏?

teacher 已经看过一条 reference solution,因此它的 next-token distribution 会把“沿着这条路写”当成高概率,而不是把所有正确替代路径都同等提高。论文把这称为 PI bias。

PI Bias Score 比较 teacher 相对 unprivileged student 对四种 target 的 log-probability advantage:reference solution、另一条 correct solution、incorrect solution、unrelated correct solution。观察到的顺序是 reference 远高于 alternative correct,后者只略好于 incorrect,并接近 unrelated correct。

Q2. 这篇反驳了哪些结论,又没有反驳什么?

结论论文证据
“dense SD loss 单独能教 correctness”在 harder tasks 上不成立
“full reference PI 一定优于其他 context”不成立,reference-path bias 很强
“所有 self-distillation 都无效”没有证明
“reward + routing + local credit 也无效”没有测试

它的实验是故意拿掉 reward 的压力测试。阅读时不要把“lone objective 失败”误写成“OPSD 在任何组合里都失败”。

Q3. PI Bias Score 与训练设置怎么做?

Qwen3-8B think/instruct,补充 Qwen3-32B;MMLU-Pro、DAPO-Math、CodeForces、BFCL multi-turn。QA、math、code 各 2,000 items,BFCL 100 tasks。JSD clip 0.001,EMA 0.001,LR 多数 1e-5,code/agent 1e-6,batch 32,八 rollouts,三 epochs,response 16,384,8×B200。

诊断不只看 accuracy,还把 token 按 reference path、exploration、stopword、punctuation 和 style marker 分类。这使“loss 明明下降、任务却变差”的机制可被定位。

Q4. 负面结果具体有多严重?

SettingValidation change
OPSD · general QA think−1.96
OPSD · math think−4.28
OPSD · math instruct−0.44
ordinary SD · coding think−0.30
ordinary SD · agentic think−3.51

正确 rollout 中,off-reference exploratory token 的 KL 约 0.31,on-reference token 只有 0.08。student entropy 上升、response 变短;更长 rollout、easy subset、32B scale 与 hint/skill-card PI 都没有修好。

loss 与 KL 对 correct/incorrect 的区分很弱,说明训练曲线下降不能当成 task learning 的证据。

Q5. 游戏论文必须增加什么实验?

构造一个 2×2 diagnostic:correct/incorrect × reference-near/reference-divergent。对每组测 teacher loss、KL、reward 和 update direction。最重要的一格是 correct + reference-divergent,它决定方法会不会压掉合法创新实现。

程序组用途
Correct + near确认 teacher 能利用 reference
Correct + divergent测 single-solution bias
Incorrect + near防止“像 reference 就高分”
Incorrect + divergent普通负例

再比较 reward-only、full-reference dense loss、state-gated loss 与 implicated-span loss。只报告最终 pass rate,会掩盖 method 是否靠 mode collapse 获益。

Q6. 证据和 artifact 有什么限制?

论文没有测试 reward 与 self-distillation 联合,主诊断又集中在一个 model family。它能否定“PI token matching 自身就是 correctness”,不能否定带 verifier 的 execution-grounded distillation。

paper 声称 code 在 supplementary,但公开 arXiv source tar 只有 TeX、bibliography/style 与 figures,没有 code archive 或 repository URL。兴趣程度 9.5/10;它应当成为你的 mandatory diagnostic,而不是 implementation base。

证据范围:本文阅读全文与附录,并分别检查 PDF 文本和逐页渲染;另检查公开 arXiv source tar,未发现论文所说的 supplementary code。兴趣程度 9.5/10 只表示博客作者对该方向的个人兴趣,不是通用论文评分。

留言

留言正在载入…

搜文章