[2026-01-26] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
PS-OPSD 不把完整 solution 交给 self-teacher,而是提取 initial state、goal、constraints 与 state-transition path。它说明结构化 pr…