[2026-01-26] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPHSD 把临时 inference harness 变成训练期 teacher context:student 仍直接作答,teacher 则读取 Plan–Solve 或 Draft–Verify 的 ter…
PS-OPSD 不把完整 solution 交给 self-teacher,而是提取 initial state、goal、constraints 与 state-transition path。它说明结构化 pr…