01 · 问题arXiv:2610.02140

专家答案离基础模型的生成习惯太远,会让 SFT 更难学

作者保留标准的监督微调(SFT)损失,先用基础模型重写专家解题轨迹,使训练数据更接近学生模型自己的表达分布。

分布外的专家答案

答案正确,但 token(模型处理的文本单位)序列可能处在基础模型概率很低的区域。

投影式采样

保留专家答案的信息,并沿着基础模型平均概率更高的方向反复重写后缀。

普通 SFT

最后仍使用标准交叉熵,不修改优化目标。

论文第 1、4 节1 / 12
02 · 目标分布信息投影

理想目标:在所有正确答案中,保留基础模型原来的相对概率

p_C(x) = p_base(x) · 1[x ∈ C] / Z

C 是什么

与专家轨迹信息等价的回答集合。数学和化学任务近似按最终答案是否正确判断;医疗任务使用语义等价判断。

为什么难采样

直接拒绝采样等于不断让基础模型自己尝试。困难任务上可能几乎生成不出正确轨迹。

论文第 4.1 节、定义 1、命题 12 / 12
03 · 理想算法分块 MH 采样

论文推导使用 Metropolis-Hastings(MH)采样

1开始

从正确的专家轨迹 τ 开始。

2切分

随机选择 token 位置 m。

3生成候选

把当前前缀与专家解答放进提示词,重写后缀。

4决定接受

理论上根据目标概率和正反向提议概率,随机接受或拒绝。

5重复

逐文本块、逐次马尔可夫链蒙特卡洛(MCMC)更新,移向目标分布。

论文算法 1、第 4.2-4.3 节3 / 12
04 · 公开实现只接受概率上升的近似

公开代码没有执行完整的 MH 接受规则

target_log_prob_prop = get_logprobs_vLLM(...)

if target_log_prob_prop[0] > target_log_prob_cur[0]:
    gen = prop
    target_log_prob_cur = target_log_prob_prop

代码比较整段回答在基础模型下的平均对数概率。它没有计算正反向提议概率之比,也不会随机接受概率下降的候选,因此论文关于稳定分布的证明不能直接用于这段实现。

官方仓库版本 6d3e9f0:boost_sci.py 第 188-220 行;boost_math.py 第 189-227 行4 / 12
05 · 真实案例附录 A 的化学题

把同一条配平方程解法改写成基础模型更常写的形式

题目

配平 CO₂ + H₂O → C₃H₆O₃ + O₂,并保持反应物和生成物的顺序。

必须保留的信息

最终系数与守恒关系必须正确。生成候选的提示词同时提供原题、专家解答和当前的未完成回答。

A截取前缀

在当前回答中随机选择截断位置。

B重新生成

基础模型继续写出完整推理。

C比较概率

只保留平均对数概率更高的候选。

D检查答案

生成结束后记录方程是否配平。

论文附录 A;官方 boost_sci.py 第 315-368 行5 / 12
06 · 数据边界无法保证全部正确

生成脚本会标记错误,但仍把所有数据行写入文件

代码行为

每条改写后的回答都带 is_correct,随后无条件调用 append_jsonl(out_path, rec)。

仓库说明

README 建议合并逐行 JSON 文件(JSONL),并重命名提示词和回答字段作为 SFT 数据,但没有说明是否过滤 is_correct=0。

94.33%Qwen 化学
93.94%Olmo 化学
95.33%数学
95.86%医疗
论文附录 C.1;官方仓库 boost_*.py 与 README6 / 12
07 · 主要结果Qwen 模型

Sampling SFT 在化学与数学任务上胜出

实验较强的同策略基线Sampling SFT结果
Qwen2.5-7B 化学同策略自蒸馏 OPSD 61.866.0+4.2 个百分点
Qwen2.5-3B 数学平均分GRPO 45.7 / UFT 45.253.4比 GRPO 高 7.7
Sampling SFT + 强化学习GRPO 45.756.7数学平均分最高

GRPO 按同一道题的多次回答做相对奖励;UFT 把监督微调和强化学习统一起来。两者都利用当前模型生成的回答进行训练。

论文表 1;数值为百分比准确率,差值单位为百分点。7 / 12
08 · 负结果并非所有任务都胜出

医疗任务与 Olmo 化学任务没有超过同策略自蒸馏基线 OPSD

Qwen 医疗

Sampling SFT 45.8,OPSD 46.6。Sampling 的旧能力平均分为 51.6,高于 OPSD 的 50.1。

Olmo 化学

Sampling SFT 58.3,OPSD 59.7。Sampling 的旧能力平均分为 61.7,是表中最高值。

论文的强项是兼顾新任务准确率与旧能力保留,并非每个新任务的准确率都排名第一。

论文表 1-28 / 12
09 · 旧能力保留为什么改写可能有效

数据越接近基础模型,SFT 更新通常越温和

普通 SFT

Qwen 化学实验中的旧能力平均分从基础模型的 59.7 降到 52.0。

Sampling SFT

旧能力平均分为 58.6,接近基础模型,并高于 OPSD 的 56.8。

跨模型检查

用 Olmo 改写的数据训练 Qwen,化学准确率只有 57.33,低于普通 SFT 的 61.8。

论文表 1、附录 B9 / 12
10 · 实验限制表格没有报告什么

每项结果都只来自一次实验

没有不确定性分析

  • 没有多随机种子结果
  • 没有置信区间
  • 超参数从多个范围选择,但未说明验证集选择的完整细节

公开材料不完整

  • 没有改写后的数据集
  • 没有训练模型存档
  • 没有医疗任务的数据生成流程
  • 仓库未声明许可证
论文第 5 节与附录 C;官方仓库版本 6d3e9f010 / 12
11 · 相关工作方法的位置

它在数据生成阶段让样本靠近待训练模型

路线专家信息怎样进入改变什么
普通 SFT直接拟合专家轨迹标准训练目标、原始数据
重要性加权 / KL 散度约束 SFT专家数据保持不变损失函数,或对新旧模型的分布差异加限制
GRPO / UFT(同策略训练)专家轨迹帮助生成成功回答根据当前模型自己的回答与奖励更新模型
OPSD(同策略自蒸馏)带额外上下文的教师分布自蒸馏
Sampling SFT专家解答约束候选改写普通 SFT 前的数据分布
论文相关工作与第 5 节基线11 / 12
12 · 结论兴趣度 8.0 / 10

先改造训练数据很有潜力,但理论与代码仍未对齐

值得继续研究

把昂贵的专家轨迹改写成学生模型更容易生成的轨迹,可能兼顾新能力学习与旧能力保留。

下一项实验

比较严格 MH、只接受基础模型平均概率上升的贪心搜索与简单的多次改写取最优;固定计算预算,过滤错误数据行,并报告多随机种子结果。

博客作者兴趣度只表示本人对主题的兴趣,不是论文质量评级。12 / 12