01 · 问题arXiv:2608.25580

答案对了,不代表看图和推理过程也对了

V-Rubrics 把一条视觉问答(VQA)回答拆成视觉事实、推理和指令遵循等独立评分项,再把每项训练权重放到相关回答前缀。

只看答案

最终选项正确就是 1,无法识别碰巧答对、图中数字读错或推理跳步。

逐项评分

每条评分项只判断一个事实或推理,并带正负权重。

前缀归因

判分模型返回支持该评分项的原句,训练信号只覆盖到这句话结束的位置。

论文第 1、3 节1 / 12
02 · 数据构建50,248 个样本

17 个来源经过过滤、8 次回答生成和自动评分项标注

1候选数据

示意图、图表、文档、数学与通用视觉问答。

2规则过滤

检查能否验证、是否过于简单、语言质量和重复样本。

3生成 8 次

固定的监督微调(SFT)策略模型生成回答。

4划分难度

0/8 困难;1-5 中等;6-7 简单;8/8 丢弃。

5自动标注

Gemini-3-Pro 生成视觉事实、推理一致性和指令遵循三类评分项。

论文第 3.2-3.4 节与附录 C2 / 12
03 · 数据集评分项统计

50K 样本对应 352,938 条评分项

209,436视觉忠实度 VF,59.3%
101,369推理一致性 RC,28.7%
42,133指令遵循 IF,11.9%
未报告人工抽样审核或标注者一致性。
论文附录 C.2、表 43 / 12
04 · 真实数据行AI2D 科学示意图数据集 · 样本 2501

真实案例:一张潮汐示意图被拆成六项检查

问题是 “What is represented in this image?”,即“图中表示什么?”;参考选项 (3) 是 spring tide(大潮)。rs_score 记录 8 次回答中的正确次数;0/8 表示全部答错,因此属于困难样本。

评分项名称类型权重要求
Identify_ObjectsVF5识别太阳、地球、月球。
Visual_AlignmentVF5指出三者在一条直线上。
Tidal_Bulge_ObservationVF4识别海洋潮汐隆起。
Reasoning_Alignment_EffectRC4解释引力叠加造成最高高潮。
Selection_of_Spring_TideIF5选择大潮 / 第 3 项。
Distinguish_from_Neap_TideRC3说明小潮需要 90° 夹角。
Hugging Face 官方数据行:唯一编号(UID)chart_02501_3c2e68644 / 12
05 · 部分得分沿用同一案例

只答 “spring tide” 会得到什么?

评分项得分

若判分模型只认定 Selection_of_Spring_Tide 成立,则正权重总和为 26,评分项得分 = 5 / 26 = 0.1923。

论文中的语义奖励

若最终答案奖励为 1 且 α=0.5,则 R = 0.5×1 + 0.5×0.1923 = 0.5962。训练时还会在同题回答之间做标准化。

这个分数按公开数据行与论文公式重算。真实判分模型可能对其他评分项给出不同判断,因此它不是作者记录到的训练日志。

论文公式 3-7;公开数据行 25015 / 12
06 · 判分边界只根据文字核对评分项

评分项判分模型不看原图

输入模型回答

模型生成的完整文字。

输入一条评分项

Gemini 预先写好、可单独判断的描述。

判分Qwen3-VL-235B

输出是或否;前缀模式还返回支持句。

归因得分与位置

为整段回答或相关前缀构造训练权重(advantage)。

如果自动标注漏掉图中事实,训练时的判分模型无法回到原图补救;视觉忠实度奖励的上限受评分项质量约束。

论文第 3.5、4.1 节;仓库文件 sequence_rubric_reward.py6 / 12
07 · 前缀归因机制GRPO:按同题多次回答的相对得分训练

每个评分项单独标准化,再只影响相关回答前缀

Aₜ = α z(R_ans) + (1 - α) Σⱼ ρⱼ z(sⱼ) · 1[t ≤ tⱼ,end]

逐项标准化

答案奖励与每条评分项分别在同一道题的多次回答中计算标准分(z-score)。

前缀遮罩

支持句结束位置为 tⱼ,end;更早的 token(模型处理的文本单位)接收这项权重。

对齐失败

支持句无法可靠定位时,这项权重退回整段回答。

论文公式 5-7;仓库中的模糊匹配阈值为 60。7 / 12
08 · 主要结果表 1-2

相对只看答案的 GRPO,评分项奖励的平均增量有限但为正

通用与知识类

SFT
64.93
只看答案
66.25
评分项 GRPO
68.04

视觉推理类

SFT
58.45
只看答案
61.94
评分项 GRPO
62.45
图中指标按相同权重取平均;评分项方法比只看答案高 1.79 和 0.51 个百分点。8 / 12
09 · 负结果并非所有评测都提升

部分评测基准上,评分项模型反而低于只看答案的 GRPO

评测指标只看答案评分项 GRPO差值
MMBench-Dev86.9486.51-0.43
MathVerse V/O52.1649.37-2.79
CharXiv 推理项57.0056.60-0.40
MathVision 测试集56.7158.88+2.17
LogicVista60.6362.42+1.79
论文表 1-2;差值按表中数据重算,单位为百分点。9 / 12
10 · 消融实验警告论文配置与公开默认值

两个公开启动脚本同时改变了奖励权重与归因方法

公开模式答案格式评分项作用范围
rubric-sequence0.100.100.80整段回答
rubric-prefix0.500.050.45逐项标准化 + 前缀

论文表 3 报告 67.74→68.04,并说明差异同时包含逐项标准化与前缀定位。若用公开默认配置复现,还会同时改变奖励权重;当前材料不足以把 0.30 个百分点归给单一机制。

官方仓库版本 6515819:training/rl/README.md 与 paper_grpo.sh10 / 12
11 · 可复现性已知配置差异

代码公开程度较高,但复现实验仍需记录被覆盖的默认参数

已经公开

  • 50K 数据集与评分项格式
  • 答案、整段评分项、前缀评分项三种奖励代码
  • 开源强化学习训练框架 VERL 的修改补丁、评测程序与测试

仍需澄清

  • 论文学习率 2e-6;启动脚本默认 1e-6
  • 论文答案基线批大小 480;启动脚本默认 192
  • Gemini 自动标注没有人工审计
  • 上游图片许可不统一
论文表 6;官方仓库版本 651581911 / 12
12 · 结论兴趣度 7.5 / 10

可复用的设计:把回答拆成可独立判断的陈述

有效的部分

最终答案、视觉事实、推理步骤与指令约束不再挤进一个数值;模型可以得到局部训练权重。

下一项实验

固定相同的奖励总权重,只改变整段、逐项和前缀三种归因方式;同时让判分模型看到原图,并抽样做人工标注审计。

博客作者兴趣度只表示本人对主题的兴趣,不是论文质量评级。12 / 12