PS-OPSD 试图保留 reference solution 里的“问题结构”,删掉具体答案与表面推导。对游戏代码,它对应的不是完整 project,而是 assets/initial state、success conditions、engine constraints 和实现 transitions。
Q1. 为什么把 solution 改写成 problem space?
完整 solution 绑定一个具体推理轨迹,还可能让 teacher 依赖 final answer;problem-space guidance 只保留可执行的状态变化。它希望 teacher 提供“下一步应满足什么条件”,而不是“reference 下一行写了什么”。
这种表示对多解问题更自然,但仍来自一条 verified path,不等于覆盖所有合法 solution space。
Q2. 四个字段分别承担什么角色?
| 字段 | 含义 | 游戏代码类比 |
|---|---|---|
| Initial state | 题目已知对象与关系 | assets、starter repo、scene state |
| Goal conditions | 成功必须满足的状态 | hidden tests、gameplay outcomes |
| Constraints | 不可违反的规则 | engine/API/version 限制 |
| State transitions | operator + preconditions + result | 实现或 repair steps |
extractor 是 Qwen3.6-35B-A3B,离线读取 OpenThoughts problem 与 verified solution。guidance 删掉 instantiated final answer,student rollout 与 OPSD objective 保持不变。
Q3. PS-OPSD 的训练与对照怎样设计?
student 只看 question,teacher 看四字段 guidance 并评分 student 自己的 tokens。模型为 Qwen3-1.7B/4B/8B;每个 benchmark 对每题评 12 个 stored generations。
4B ablation 同时测试 flattened fields、wrong-problem matched-length guidance 和 corrupted transition order。它们分别得到 63.61、61.76、62.19,完整 PS-OPSD 是 64.32。结构、relevance 和顺序都有贡献。
Q4. 结果与 checkpoint 聚合有什么限制?
| 模型 | Base | OPSD | PS-OPSD |
|---|---|---|---|
| 1.7B | 36.67 | 41.08 | 43.12 |
| 4B | 61.76 | 61.70 | 64.32 |
| 8B | 62.31 | 63.58 | 65.40 |
PS-OPSD 在三个 scale 都高于 OPSD,但 Avg 仍可能混合每个 benchmark 独立选出的最佳 checkpoint。90 个 benchmark problems 中,相对 base 改善 18 个、退化 7 个,总体 +2.56。
explicit PI invocation 在 4B train problems 从 OPSD 的 3.0% 降到 0.5%,held-out 从 2.2% 降到 0.4%。这是行为 proxy,不是严格的信息泄漏证明。
Q5. 游戏版 problem-space context 应该长什么样?
先生成 implementation-neutral contract,再决定是否给 transition path。例如:initial assets/scene obligations、mechanic success predicates、Godot version 与 allowed APIs、需要创建的 signals/state transitions。不要出现 reference node path、class name 或具体 code span。
至少加入同长度 prose、wrong-game context、shuffled transitions 与 no-transition controls,判断 gain 来自 semantic structure 还是仅仅来自更多提示。
Q6. 为什么它只能当概念参照?
论文没有公开 official repository、run manifests、exact temperature、clipping threshold、完整 batch/LR/update/LoRA 设置。因此 64.32/65.40 可以作为 paper claim,不能当作可直接复跑的 baseline。
兴趣程度 8/10。它很适合设计 game context family,但 state transition 仍来自一条 reference path;后续必须用 SMRC-SD 的 state matching 决定何时 abstain。
证据范围:本文阅读全文,并分别检查 PDF 文本和逐页渲染。论文未提供 official repository 或 run manifest;代码可用性按 2026-10-08 的公开检索结果记录。兴趣程度 8/10 只表示博客作者对该方向的个人兴趣,不是通用论文评分。
留言