V-Rubrics 认为视觉推理的奖励太粗。模型即使看错图、推理出错,也可能碰巧选中正确答案;只检查最终答案的奖励(answer-only reward)仍然会给 1。作者把参考回答拆成多条可独立判断的评分项(rubric items),再把每项训练权重放到与它相关的回答前缀,希望模型知道“究竟是哪一条视觉事实或推理成立”。
Q1. 为什么只看最终答案的奖励无法训练视觉忠实度?
一条答案可以包含多个局部判断,最终正确与这些判断全部正确不是一回事。
图表题里,模型可能读错一个柱子的高度,却通过其他线索猜对选项;几何题里,模型可能识别出形状,却使用不成立的关系完成推导。只看最终答案的 GRPO 把这些情况都压成一个数值。对于同一问题的多次生成结果,模型只知道哪次答对,不知道哪条视觉陈述值得保留。
V-Rubrics 先把参考答案拆成“每条只表达一个事实或推理”的判断项,再让判分模型分别输出是或否。正权重评分项提供部分得分;PITFALL 是描述“回答中不能出现什么错误”的负权重条目,一旦判分模型认定回答触发了它,最终答案得分与正评分项得分都会被取消。
Q2. 它与已有视觉模型强化学习和评分项奖励有什么区别?
论文把三件已有思路接在一起:自动生成评分项、逐项判断回答,再把每项 advantage 放到能够对齐的回答前缀。
| 路线 | 训练信号 | 主要缺口 | V-Rubrics 的位置 |
|---|---|---|---|
| 只看答案的视觉强化学习 | 最终答案是否正确 | 无法区分视觉事实、推理和格式错误 | 保留答案奖励,同时增加逐项评分标准。 |
| 大语言模型(LLM)整段判分 | 整条回答的单一分数 | 具体错误仍被折叠 | 每条评分项独立判断是或否,再归一化正权重。 |
| 基于评分项的奖励 | 多条判断标准或评分表 | 常把各项分数汇总到整段回答 | 每条评分项分别在同一道题的多次回答中做标准化。 |
| 过程归因 / token 归因 | 每一步或每个 token 的信号 | 需要可靠地把证据与回答位置对齐 | 用支持句的结束位置生成前缀遮罩;对齐失败时退回整段回答。 |
相较 OMR、MMR1、MM-Eureka 等视觉强化学习系统,这篇论文的重点不在扩大推理轨迹数据,而在改变奖励结构。结论也应限制在这套 Qwen3-VL-8B 训练配置上;表格中的闭源模型和其他开源模型使用不同数据与训练预算,不能当成受控方法比较。
Q3. 50K 数据、判分模型和前缀权重是怎样连起来的?
数据构建与训练时判分是两个阶段,使用的模型也不同。
作者先在 OpenMMReasoner-SFT-874K 上做监督微调(SFT),得到固定的 πSFT 模型。这个模型存档用来反复生成候选回答并按正确性筛选,也分别初始化可训练的策略模型和固定不更新的参考模型;后者用于计算 KL 距离,也就是衡量训练后的回答分布偏离起点有多远。
随后,17 个视觉数据源经过基于规则的过滤。πSFT 对每个候选问题生成 8 次回答:
| 8 次回答中的正确数 | 难度 | 是否进入 50K |
|---|---|---|
| 0 | 困难 | 保留 |
| 1-5 | 中等 | 保留 |
| 6-7 | 简单 | 保留 |
| 8 | 过于简单 | 丢弃 |
最终得到 18,121 个困难样本、25,306 个中等样本和 6,821 个简单样本。Gemini-3-Pro 根据图像、问题指令与参考回答,为每条样本生成 JSON 格式的评分项。总计 352,938 条,其中 VF 209,436、RC 101,369、IF 42,133。论文没有报告人工逐条审计或标注者一致性。
真实案例:AI2D original_id=2501
公开数据中的 spring tide 问题
- 来源:AI2D,公开数据行的 UID(唯一编号)为 `chart_02501_3c2e6864`;`rs_score` 记录固定模型 8 次回答中的正确次数,`rs_score=0/8` 因此表示 8 次都答错,样本被归为困难。
- 问题:`What is represented in this image?`,即“图中表示什么?”;四个选项中的第 3 项是 `spring tide(大潮)`。
- 评分项:识别太阳、地球、月球(VF, 5);识别三者共线(VF, 5);识别潮汐隆起(VF, 4);解释引力叠加(RC, 4);选择大潮(IF, 5);区分小潮需要 90° 夹角(RC, 3)。
- 可见边界:待训练模型能看图像和问题指令。评分项判分模型只看模型回答与其中一条判断标准,不看原图。
- 通过条件:每条判断标准独立得到“是”或“否”。一个回答可以通过选项评分项,同时在视觉与推理评分项上失败。
若模型只回答 spring tide,并且判分模型只把 Selection_of_Spring_Tide 这一项判为 1,则正评分项的权重总和是 26,Rrub=5/26≈0.1923。论文公式取 α=0.5,最终答案奖励为 1,因此语义奖励为:
这是根据公开数据行与公式重算的解释性过程,不是作者发布的真实奖励日志。判分模型是否会额外认定其他评分项成立,要看它对具体回答的判断。
在前缀模式中,每条评分项的“是/否”结果会在同一道题的多次回答中单独标准化。判分模型若返回一段支持句,代码先做完全匹配和忽略大小写的匹配,再用阈值 60 的模糊匹配尝试定位;仍找不到时,这项权重退回整段回答。
这个数据行还有一个分类问题:数据把“选择大潮”标成 IF。这个判断更接近答案正确性,不是典型的格式或指令约束,说明 VF、RC、IF 标签并不总能把三类能力分得很干净。
Q4. 实验结果到底有多大,哪些评测没有提升?
使用评分项奖励的 GRPO 相对共同 SFT 起点提升明显;相对只看答案的 GRPO,额外收益是 1.79 与 0.51 个百分点。
| 模型阶段 | 通用与知识类平均分 | 视觉推理类平均分 |
|---|---|---|
| SFT | 64.93 | 58.45 |
| 只看答案的 GRPO | 66.25 | 61.94 |
| 评分项 GRPO | 68.04 | 62.45 |
评分项模型并非每项都更高。它在 MMBench-Dev 上比只看答案的模型低 0.43 个百分点,在 MathVerse V/O 上低 2.79,在 CharXiv 推理项上低 0.40;MathVision、DynaMath、WeMath 与 LogicVista 则上升。作者认为,多步视觉事实和推理若能被评分项覆盖,方法更容易奏效;对于要求符号答案完全准确或带有数据集特定规范的任务,评分项和最终评测指标可能并不一致。
表 3 能否证明前缀定位有效?
论文的三档结果是:只看答案为 66.25;把评分项作用于整段回答为 67.74;逐项标准化并作用于前缀为 68.04。最后 0.30 个百分点同时包含“每项分别标准化”和“前缀定位”两处变化,论文自己也没有把两者拆开。
公开仓库还带来另一层复现风险。版本 6515819 的两个官方启动脚本默认使用不同的奖励权重:
| 公开模式 | 答案奖励 | 格式奖励 | 评分项奖励 | 权重作用范围 |
|---|---|---|---|---|
| `rubric-sequence` | 0.10 | 0.10 | 0.80 | 整段回答 |
| `rubric-prefix` | 0.50 | 0.05 | 0.45 | 逐项标准化后作用于前缀 |
论文附录 D.2 报告答案与评分项的语义奖励比例为 0.5/0.5,并将格式奖励另列。公开版本的变更记录说明,前缀模式的总奖励权重后来才统一为 1.0。由这些材料无法确认表 3 的整段回答模式是否使用了完全相同的奖励权重。因此,公开默认值不能直接证明 0.30 个百分点全部来自前缀定位。
Q5. 如果继续做这条路线,哪些实验最有价值?
最优先的实验是固定各项奖励的总权重,只改变奖励如何拆分以及哪些 token 接收权重。
至少需要四组:只看答案;答案加汇总后的评分项;评分项分别标准化但作用于整段回答;评分项分别标准化并作用于前缀。四组保持批大小、学习率、每题生成次数,以及答案/评分项/格式奖励的总权重一致。这样才能区分收益来自更多监督信息、每项独立标准化,还是前缀定位。
其次,应增加一组让判分模型看到原图的对照。当前只看文字的判分模型更便宜,评分标准也容易审计;但自动标注一旦写错,它无法回到图像纠正。可以在人类抽样审核过的子集上,比较只看文字和同时看图的判分模型准确率及训练收益。
最后,需要报告自动评分项的质量:随机抽样覆盖每个数据来源、难度与评分项类型,记录事实是否正确、一条评分项是否只表达一个判断、类型标签是否合适、有无遗漏,以及人类标注者是否一致。50K 数据规模本身不能回答这些问题。
Q6. 最终应该怎样评价 V-Rubrics?
它给出了完整、可运行的细粒度视觉强化学习流程;目前的证据更支持“评分项奖励有增益”,还不足以单独证明前缀定位是主要原因。
这篇适合关心多模态强化学习、大语言模型判分与细粒度训练权重归因的读者。最可迁移的部分是“把一条回答拆成几条可独立判断的陈述”;最不该跳过的部分是评分项由谁生成、判分模型看得到什么,以及消融实验有没有同时修改其他变量。
主要来源:论文 v1 全文与附录、V-Rubrics 官方仓库版本 6515819、V-Rubrics 50K 公开数据行 `chart_02501_3c2e6864`。代码与数据检查日期:2026-10-06。
留言