[2026-01-26] Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
OPSD 让同一个模型在两种上下文下分别充当学生和 teacher:学生只看问题并生成自己的轨迹,teacher 额外看到 verified solution,再给同一批 token 密集监督。本文同时核对论文与官…
π-Distill 面向多轮 agent:frontier teacher 不开放 hidden reasoning,只留下成功的 action/tool-call trace。论文研究怎样把这类 action-o…
这篇反例论文说明 PI-conditioned teacher 可能奖励 reference-path similarity,而不是 correctness。它对 QA、数学、代码和多轮 tool use 的 de…