核心结论:V-Rubrics 将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让图像中的事实、推理步骤和任务要求分别参与奖励计算。基于同一 SFT 起点和同一批 RL 数据,rubric GRPO 在通用与知识评测中的 Overall Avg. 达到 68.04。 多模态模型给 本文链接