ViCuR 不是让 teacher 看 final answer,而是看从原始 image/video 中抽取的 question-relevant cue。student 部署时虽然没有 cue text,底层视觉证据仍在输入里,因此理论上可以自己恢复。
Q1. Answer-side privilege 为什么会制造 mismatch?
teacher 如果直接看到 reference answer 或 rationale,它的 next-token preference 可能依赖 student 在 inference 时永远无法恢复的信息。ViCuR 改为提供 visual cue:一段指向原图 relevant region、relation 或 evidence 的文字。
论文用理想条件 S=f(X) 表达“cue 由 inference input 决定”。真实 cue generator 是外部模型或 annotator,所以只能近似满足。
Q2. 它与 Visual-SDPO 的 visual feedback 有何不同?
| 工作 | 视觉证据来源 | student inference 时能否重新获得 |
|---|---|---|
| ViCuR | 原始 input image/video | 能,原图仍在 |
| Visual-SDPO | 执行 student code 后的 render | 必须重新执行 |
| Answer-OPSD | reference answer/rationale | 通常不能 |
这一区分对游戏最重要:asset screenshot、query video 和 GDD 中的视觉要求属于 input;当前 build 的 screenshot、physics event 与 hidden test 属于 environment feedback。
Q3. SinkTrack module 实际做什么?
大约每五个 decoder layers,专用 sink token 在 prefill 中对全部 visual tokens 做一次 cross-attention。只有 sink hidden state 被 residual update;autoregressive decoding 不增加每-token 的 cross-attention。
module 给 2B backbone 增加 100.7M 参数(4.52%),给 8B 增加 536.9M(5.77%)。teacher 训练时额外看 cue text,student 学会把相关视觉证据压进 sink representation。
Q4. setting 与结果到底怎样?
Qwen3-VL-2B/8B student,8B/32B stronger teacher;Vision-R1 data;8×H200;prompt 2,048,response 4,096,batch 128,LR 1e-6,五 epochs、275 steps。distillation 每题一个 rollout,GRPO 五个。
| 设置 | OPSD | OPSD + ViCuR |
|---|---|---|
| 2B overall | 44.88 | 46.07 |
| 8B overall | 58.15 | 59.39 |
| 8B stronger-teacher OPD | 63.88 | 64.96 |
2B 与 8B 分别提升 1.19 和 1.24,但 ordinary OPSD 在这组实验里低于未训练 base。cue 本身贡献了大部分 gain;recovery module 并非每个 benchmark 都提升,8B 还出现 cross-benchmark overfitting。
Q5. 对 multimodal game query 应怎样分层?
先把 query-side cue 与 build-side feedback 分成两条实验线。query-side 可以抽取资产类型、场景对象、视角、UI slot、目标 mechanic 等 recoverable cue;build-side 则放 compile/runtime/render/gameplay evidence。
如果 cue generator 使用 reference code 才知道的 node 名、隐藏测试或最终答案,它就不再是 recoverable visual cue。建议做遮蔽审计:只看原始 query 的 annotator 能否独立确认每条 cue。
Q6. 官方 repo 还缺哪些关键东西?
仓库有 SinkTrack 的 Transformers/vLLM model files 与 distillation plumbing,但没有 cue-generation pipeline、prepared teacher_prompt data 或 trained recovery checkpoint。example script 还有 placeholder path。
因此 ViCuR 适合帮助你定义 context taxonomy,不适合作为第一条可直接复现实验线。兴趣程度 7.5/10;应当在 execution-grounded baseline 之后再测 cue recovery module。
证据范围:本文阅读全文与附录,并分别检查 PDF 文本和逐页渲染;代码结论固定到文中注明的 commit。兴趣程度 7.5/10 只表示博客作者对该方向的个人兴趣,不是通用论文评分。
留言