论文解读·

[2026-08-03] Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning

PS-OPSD 不把完整 solution 交给 self-teacher,而是提取 initial state、goal、constraints 与 state-transition path。它说明结构化 problem space 比原始 trace 更好,但论文没有公开 code 与 ru…

页数
9
形式
交互图解
更新
2026.10.08
文章目录

Xuyang Zhao, Liting Zhang, Zichen Xu, et al. · arXiv:2608.01589v1 · 最早公开于 2026-08-03

9 页交互图解 · 先看训练链、真实 case 与复现边界大屏阅读 ↗

使用按钮或 ← → 翻页,F 进入或退出全屏按 Esc 退出全屏;独立打开后可返回文章

PS-OPSD 试图保留 reference solution 里的“问题结构”,删掉具体答案与表面推导。对游戏代码,它对应的不是完整 project,而是 assets/initial state、success conditions、engine constraints 和实现 transitions。

64.324B PS-OPSD
65.408B PS-OPSD
0.5%4B train PI invocation
8/10个人兴趣程度

Q1. 为什么把 solution 改写成 problem space?

完整 solution 绑定一个具体推理轨迹,还可能让 teacher 依赖 final answer;problem-space guidance 只保留可执行的状态变化。它希望 teacher 提供“下一步应满足什么条件”,而不是“reference 下一行写了什么”。

这种表示对多解问题更自然,但仍来自一条 verified path,不等于覆盖所有合法 solution space。

Q2. 四个字段分别承担什么角色?

字段含义游戏代码类比
Initial state题目已知对象与关系assets、starter repo、scene state
Goal conditions成功必须满足的状态hidden tests、gameplay outcomes
Constraints不可违反的规则engine/API/version 限制
State transitionsoperator + preconditions + result实现或 repair steps

extractor 是 Qwen3.6-35B-A3B,离线读取 OpenThoughts problem 与 verified solution。guidance 删掉 instantiated final answer,student rollout 与 OPSD objective 保持不变。

Q3. PS-OPSD 的训练与对照怎样设计?

student 只看 question,teacher 看四字段 guidance 并评分 student 自己的 tokens。模型为 Qwen3-1.7B/4B/8B;每个 benchmark 对每题评 12 个 stored generations。

4B ablation 同时测试 flattened fields、wrong-problem matched-length guidance 和 corrupted transition order。它们分别得到 63.61、61.76、62.19,完整 PS-OPSD 是 64.32。结构、relevance 和顺序都有贡献。

Q4. 结果与 checkpoint 聚合有什么限制?

模型BaseOPSDPS-OPSD
1.7B36.6741.0843.12
4B61.7661.7064.32
8B62.3163.5865.40

PS-OPSD 在三个 scale 都高于 OPSD,但 Avg 仍可能混合每个 benchmark 独立选出的最佳 checkpoint。90 个 benchmark problems 中,相对 base 改善 18 个、退化 7 个,总体 +2.56。

explicit PI invocation 在 4B train problems 从 OPSD 的 3.0% 降到 0.5%,held-out 从 2.2% 降到 0.4%。这是行为 proxy,不是严格的信息泄漏证明。

Q5. 游戏版 problem-space context 应该长什么样?

先生成 implementation-neutral contract,再决定是否给 transition path。例如:initial assets/scene obligations、mechanic success predicates、Godot version 与 allowed APIs、需要创建的 signals/state transitions。不要出现 reference node path、class name 或具体 code span。

至少加入同长度 prose、wrong-game context、shuffled transitions 与 no-transition controls,判断 gain 来自 semantic structure 还是仅仅来自更多提示。

Q6. 为什么它只能当概念参照?

论文没有公开 official repository、run manifests、exact temperature、clipping threshold、完整 batch/LR/update/LoRA 设置。因此 64.32/65.40 可以作为 paper claim,不能当作可直接复跑的 baseline。

兴趣程度 8/10。它很适合设计 game context family,但 state transition 仍来自一条 reference path;后续必须用 SMRC-SD 的 state matching 决定何时 abstain。

证据范围:本文阅读全文,并分别检查 PDF 文本和逐页渲染。论文未提供 official repository 或 run manifest;代码可用性按 2026-10-08 的公开检索结果记录。兴趣程度 8/10 只表示博客作者对该方向的个人兴趣,不是通用论文评分。

留言

留言正在载入…

搜文章