[2026-01-26] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPCD 研究怎样把历史经验或优化过的 system prompt 蒸馏进模型参数。它保留 student 的 on-policy rollout,再让 context-conditioned teacher 对同…
OPHSD 把临时 inference harness 变成训练期 teacher context:student 仍直接作答,teacher 则读取 Plan–Solve 或 Draft–Verify 的 ter…
ViCuR 区分 answer-side privilege 与可从原图恢复的 visual cue,并用 SinkTrack 让一个 sink token 定期读取全体 visual tokens。它适合帮助定义…
SMRC-SD 把成功 trajectory 当成 state-indexed resource:只有 student 当前执行状态与 reference prefix 匹配时才启用 dense distillat…
LOPD 检索成功经验并压成 continuous latent tokens,由 latent-conditioned frozen teacher 监督 student on-policy trajectory…