只看答案
最终选项正确就是 1,无法识别碰巧答对、图中数字读错或推理跳步。
逐项评分
每条评分项只判断一个事实或推理,并带正负权重。
前缀归因
判分模型返回支持该评分项的原句,训练信号只覆盖到这句话结束的位置。
V-Rubrics 把一条视觉问答(VQA)回答拆成视觉事实、推理和指令遵循等独立评分项,再把每项训练权重放到相关回答前缀。
最终选项正确就是 1,无法识别碰巧答对、图中数字读错或推理跳步。
每条评分项只判断一个事实或推理,并带正负权重。
判分模型返回支持该评分项的原句,训练信号只覆盖到这句话结束的位置。
示意图、图表、文档、数学与通用视觉问答。
检查能否验证、是否过于简单、语言质量和重复样本。
固定的监督微调(SFT)策略模型生成回答。
0/8 困难;1-5 中等;6-7 简单;8/8 丢弃。
Gemini-3-Pro 生成视觉事实、推理一致性和指令遵循三类评分项。
问题是 “What is represented in this image?”,即“图中表示什么?”;参考选项 (3) 是 spring tide(大潮)。rs_score 记录 8 次回答中的正确次数;0/8 表示全部答错,因此属于困难样本。
| 评分项名称 | 类型 | 权重 | 要求 |
|---|---|---|---|
| Identify_Objects | VF | 5 | 识别太阳、地球、月球。 |
| Visual_Alignment | VF | 5 | 指出三者在一条直线上。 |
| Tidal_Bulge_Observation | VF | 4 | 识别海洋潮汐隆起。 |
| Reasoning_Alignment_Effect | RC | 4 | 解释引力叠加造成最高高潮。 |
| Selection_of_Spring_Tide | IF | 5 | 选择大潮 / 第 3 项。 |
| Distinguish_from_Neap_Tide | RC | 3 | 说明小潮需要 90° 夹角。 |
若判分模型只认定 Selection_of_Spring_Tide 成立,则正权重总和为 26,评分项得分 = 5 / 26 = 0.1923。
若最终答案奖励为 1 且 α=0.5,则 R = 0.5×1 + 0.5×0.1923 = 0.5962。训练时还会在同题回答之间做标准化。
这个分数按公开数据行与论文公式重算。真实判分模型可能对其他评分项给出不同判断,因此它不是作者记录到的训练日志。
模型生成的完整文字。
Gemini 预先写好、可单独判断的描述。
输出是或否;前缀模式还返回支持句。
为整段回答或相关前缀构造训练权重(advantage)。
如果自动标注漏掉图中事实,训练时的判分模型无法回到原图补救;视觉忠实度奖励的上限受评分项质量约束。
答案奖励与每条评分项分别在同一道题的多次回答中计算标准分(z-score)。
支持句结束位置为 tⱼ,end;更早的 token(模型处理的文本单位)接收这项权重。
支持句无法可靠定位时,这项权重退回整段回答。
| 评测指标 | 只看答案 | 评分项 GRPO | 差值 |
|---|---|---|---|
| MMBench-Dev | 86.94 | 86.51 | -0.43 |
| MathVerse V/O | 52.16 | 49.37 | -2.79 |
| CharXiv 推理项 | 57.00 | 56.60 | -0.40 |
| MathVision 测试集 | 56.71 | 58.88 | +2.17 |
| LogicVista | 60.63 | 62.42 | +1.79 |
| 公开模式 | 答案 | 格式 | 评分项 | 作用范围 |
|---|---|---|---|---|
| rubric-sequence | 0.10 | 0.10 | 0.80 | 整段回答 |
| rubric-prefix | 0.50 | 0.05 | 0.45 | 逐项标准化 + 前缀 |
论文表 3 报告 67.74→68.04,并说明差异同时包含逐项标准化与前缀定位。若用公开默认配置复现,还会同时改变奖励权重;当前材料不足以把 0.30 个百分点归给单一机制。
最终答案、视觉事实、推理步骤与指令约束不再挤进一个数值;模型可以得到局部训练权重。
固定相同的奖励总权重,只改变整段、逐项和前缀三种归因方式;同时让判分模型看到原图,并抽样做人工标注审计。