下载PDF或阅读论文:LlamaFactory - huggingface daily paper - 每日论文解读 | LlamaFactory | LlamaFactory

摘要

奖励模型在训练视觉-语言模型(VLMs)中发挥着至关重要的作用,通过评估输出质量来实现与人类偏好的对齐。尽管它们的重要性不言而喻,但研究界在评估VLMs中多模态奖励模型方面仍缺乏全面的公开基准。为了填补这一空白,我们推出了Multimodal RewardBench,这是一个专家标注的基准,涵盖六个领域:一般正确性、偏好、知识、推理、安全和视觉问答。我们的数据集包含从各种VLMs收集的5,211个标注的三元组(提示、选中的响应、被拒绝的响应)。在评估一系列VLM评委时,我们发现即使是表现最顶尖的模型,Gemini 1.5 Pro和Claude 3.5 Sonnet,整体准确率也只有72%。值得注意的是,大多数模型在推理和安全领域表现不佳。这些发现表明,Multimodal RewardBench为多个领域奖励模型的发展提供了一个具有挑战性的测试平台。我们将在https://github.com/facebookresearch/multimodal_rewardbench发布该基准。

一句话总结

本文提出了Multimodal RewardBench,一个用于评估视觉语言模型(VLM)奖励模型的综合专家标注基准,涵盖了六个领域,包括一般正确性、偏好、知识、推理、安全和视觉问答。

问题1:这篇论文想要解决什么具体问题?

  • 问题背景:当前缺乏用于评估多模态奖励模型的综合开放基准。

  • 现有方案不足:现有的评估基准通常仅限于文本模态,且对VLM奖励模型的评估有限,缺乏专家标注和跨多个领域的全面覆盖。

  • 研究目标:开发一个综合、专家标注的基准,用于评估VLM奖励模型,涵盖六个关键领域:一般正确性、偏好、知识、推理、安全和视觉问答。

问题2:论文的核心创新点是什么?

  • 技术创新:构建了一个包含多模态提示、选择响应和拒绝响应的三元组数据集。

  • 方法改进:采用专家标注和高质量标注,确保高标注者间一致性。

  • 优势:提供了一个全面的评估框架,覆盖了VLM奖励模型的多个关键领域,为奖励模型的发展提供了挑战性的测试平台。

问题3:实验结果如何验证了方法的有效性?

  • 关键实验:在Multimodal RewardBench上评估了多种VLM法官的性能。

  • 性能提升:最顶尖的模型(Gemini 1.5 Pro和Claude 3.5 Sonnet)的整体准确率为72%,远低于人类表现水平。

  • 对比结果:大多数模型在推理和安全任务上表现不佳,表明该基准为评估多模态奖励模型提供了具有挑战性的测试平台。

问题4:这个研究的实际应用价值是什么?

  • 应用场景:用于评估和改进VLM奖励模型,以实现更准确、有帮助和安全的输出。

  • 实施建议:使用Multimodal RewardBench进行基准测试,以识别模型的优势和不足。

  • 局限与展望:当前基准仅评估了VLM-as-a-judge方法,未来将评估回归/分类器基于的VLM奖励模型,并扩展更多安全相关方面。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐