分布外的专家答案
答案正确,但 token(模型处理的文本单位)序列可能处在基础模型概率很低的区域。
投影式采样
保留专家答案的信息,并沿着基础模型平均概率更高的方向反复重写后缀。
普通 SFT
最后仍使用标准交叉熵,不修改优化目标。
作者保留标准的监督微调(SFT)损失,先用基础模型重写专家解题轨迹,使训练数据更接近学生模型自己的表达分布。
答案正确,但 token(模型处理的文本单位)序列可能处在基础模型概率很低的区域。
保留专家答案的信息,并沿着基础模型平均概率更高的方向反复重写后缀。
最后仍使用标准交叉熵,不修改优化目标。
与专家轨迹信息等价的回答集合。数学和化学任务近似按最终答案是否正确判断;医疗任务使用语义等价判断。
直接拒绝采样等于不断让基础模型自己尝试。困难任务上可能几乎生成不出正确轨迹。
从正确的专家轨迹 τ 开始。
随机选择 token 位置 m。
把当前前缀与专家解答放进提示词,重写后缀。
理论上根据目标概率和正反向提议概率,随机接受或拒绝。
逐文本块、逐次马尔可夫链蒙特卡洛(MCMC)更新,移向目标分布。
target_log_prob_prop = get_logprobs_vLLM(...)
if target_log_prob_prop[0] > target_log_prob_cur[0]:
gen = prop
target_log_prob_cur = target_log_prob_prop代码比较整段回答在基础模型下的平均对数概率。它没有计算正反向提议概率之比,也不会随机接受概率下降的候选,因此论文关于稳定分布的证明不能直接用于这段实现。
配平 CO₂ + H₂O → C₃H₆O₃ + O₂,并保持反应物和生成物的顺序。
最终系数与守恒关系必须正确。生成候选的提示词同时提供原题、专家解答和当前的未完成回答。
在当前回答中随机选择截断位置。
基础模型继续写出完整推理。
只保留平均对数概率更高的候选。
生成结束后记录方程是否配平。
每条改写后的回答都带 is_correct,随后无条件调用 append_jsonl(out_path, rec)。
README 建议合并逐行 JSON 文件(JSONL),并重命名提示词和回答字段作为 SFT 数据,但没有说明是否过滤 is_correct=0。
| 实验 | 较强的同策略基线 | Sampling SFT | 结果 |
|---|---|---|---|
| Qwen2.5-7B 化学 | 同策略自蒸馏 OPSD 61.8 | 66.0 | +4.2 个百分点 |
| Qwen2.5-3B 数学平均分 | GRPO 45.7 / UFT 45.2 | 53.4 | 比 GRPO 高 7.7 |
| Sampling SFT + 强化学习 | GRPO 45.7 | 56.7 | 数学平均分最高 |
GRPO 按同一道题的多次回答做相对奖励;UFT 把监督微调和强化学习统一起来。两者都利用当前模型生成的回答进行训练。
Sampling SFT 45.8,OPSD 46.6。Sampling 的旧能力平均分为 51.6,高于 OPSD 的 50.1。
Sampling SFT 58.3,OPSD 59.7。Sampling 的旧能力平均分为 61.7,是表中最高值。
论文的强项是兼顾新任务准确率与旧能力保留,并非每个新任务的准确率都排名第一。
Qwen 化学实验中的旧能力平均分从基础模型的 59.7 降到 52.0。
旧能力平均分为 58.6,接近基础模型,并高于 OPSD 的 56.8。
用 Olmo 改写的数据训练 Qwen,化学准确率只有 57.33,低于普通 SFT 的 61.8。
| 路线 | 专家信息怎样进入 | 改变什么 |
|---|---|---|
| 普通 SFT | 直接拟合专家轨迹 | 标准训练目标、原始数据 |
| 重要性加权 / KL 散度约束 SFT | 专家数据保持不变 | 损失函数,或对新旧模型的分布差异加限制 |
| GRPO / UFT(同策略训练) | 专家轨迹帮助生成成功回答 | 根据当前模型自己的回答与奖励更新模型 |
| OPSD(同策略自蒸馏) | 带额外上下文的教师分布 | 自蒸馏 |
| Sampling SFT | 专家解答约束候选改写 | 普通 SFT 前的数据分布 |
把昂贵的专家轨迹改写成学生模型更容易生成的轨迹,可能兼顾新能力学习与旧能力保留。
比较严格 MH、只接受基础模型平均概率上升的贪心搜索与简单的多次改写取最优;固定计算预算,过滤错误数据行,并报告多随机种子结果。