【每日论文】Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
下载PDF或阅读论文:LlamaFactory - huggingface daily paper - 每日论文解读 | LlamaFactory | LlamaFactory
摘要
奖励模型在训练视觉-语言模型(VLMs)中发挥着至关重要的作用,通过评估输出质量来实现与人类偏好的对齐。尽管它们的重要性不言而喻,但研究界在评估VLMs中多模态奖励模型方面仍缺乏全面的公开基准。为了填补这一空白,我们推出了Multimodal RewardBench,这是一个专家标注的基准,涵盖六个领域:一般正确性、偏好、知识、推理、安全和视觉问答。我们的数据集包含从各种VLMs收集的5,211个标注的三元组(提示、选中的响应、被拒绝的响应)。在评估一系列VLM评委时,我们发现即使是表现最顶尖的模型,Gemini 1.5 Pro和Claude 3.5 Sonnet,整体准确率也只有72%。值得注意的是,大多数模型在推理和安全领域表现不佳。这些发现表明,Multimodal RewardBench为多个领域奖励模型的发展提供了一个具有挑战性的测试平台。我们将在https://github.com/facebookresearch/multimodal_rewardbench发布该基准。
一句话总结
本文提出了Multimodal RewardBench,一个用于评估视觉语言模型(VLM)奖励模型的综合专家标注基准,涵盖了六个领域,包括一般正确性、偏好、知识、推理、安全和视觉问答。
问题1:这篇论文想要解决什么具体问题?
-
问题背景:当前缺乏用于评估多模态奖励模型的综合开放基准。
-
现有方案不足:现有的评估基准通常仅限于文本模态,且对VLM奖励模型的评估有限,缺乏专家标注和跨多个领域的全面覆盖。
-
研究目标:开发一个综合、专家标注的基准,用于评估VLM奖励模型,涵盖六个关键领域:一般正确性、偏好、知识、推理、安全和视觉问答。
问题2:论文的核心创新点是什么?
-
技术创新:构建了一个包含多模态提示、选择响应和拒绝响应的三元组数据集。
-
方法改进:采用专家标注和高质量标注,确保高标注者间一致性。
-
优势:提供了一个全面的评估框架,覆盖了VLM奖励模型的多个关键领域,为奖励模型的发展提供了挑战性的测试平台。
问题3:实验结果如何验证了方法的有效性?
-
关键实验:在Multimodal RewardBench上评估了多种VLM法官的性能。
-
性能提升:最顶尖的模型(Gemini 1.5 Pro和Claude 3.5 Sonnet)的整体准确率为72%,远低于人类表现水平。
-
对比结果:大多数模型在推理和安全任务上表现不佳,表明该基准为评估多模态奖励模型提供了具有挑战性的测试平台。
问题4:这个研究的实际应用价值是什么?
-
应用场景:用于评估和改进VLM奖励模型,以实现更准确、有帮助和安全的输出。
-
实施建议:使用Multimodal RewardBench进行基准测试,以识别模型的优势和不足。
-
局限与展望:当前基准仅评估了VLM-as-a-judge方法,未来将评估回归/分类器基于的VLM奖励模型,并扩展更多安全相关方面。
更多推荐



所有评论(0)