[2026-01-26] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
课程笔记、踩坑记录,还有一些摸鱼和日常。
复仇者不折镆干。虽有忮心,不怨飘瓦。
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPCD 研究怎样把历史经验或优化过的 system prompt 蒸馏进模型参数。它保留 student 的 on-policy rollout,再让 context-conditioned teacher 对同…
π-Distill 面向多轮 agent:frontier teacher 不开放 hidden reasoning,只留下成功的 action/tool-call trace。论文研究怎样把这类 action-o…
这篇系统比较 self-teacher 的五档 privileged context,从 full solution 到 answer-only。本文逐项核对 29,434 行公开数据、L2-L4 compiler…
Visual-SDPO 执行 student 代码,把 screenshot、rubric 与 runtime error 作为 teacher-only context,再把视觉 defect 定位回负责的 co…
OPHSD 把临时 inference harness 变成训练期 teacher context:student 仍直接作答,teacher 则读取 Plan–Solve 或 Draft–Verify 的 ter…
ViCuR 区分 answer-side privilege 与可从原图恢复的 visual cue,并用 SinkTrack 让一个 sink token 定期读取全体 visual tokens。它适合帮助定义…
这篇反例论文说明 PI-conditioned teacher 可能奖励 reference-path similarity,而不是 correctness。它对 QA、数学、代码和多轮 tool use 的 de…
PS-OPSD 不把完整 solution 交给 self-teacher,而是提取 initial state、goal、constraints 与 state-transition path。它说明结构化 pr…
SMRC-SD 把成功 trajectory 当成 state-indexed resource:只有 student 当前执行状态与 reference prefix 匹配时才启用 dense distillat…