Q-BENCH:从单个图像到对的低水平视觉上的多模式基础模型的基准
IEEE transactions on pattern analysis and machine intelligence
|August 21, 2024
概括
本研究介绍了评估低水平视觉任务中的多模式大语言模型 (MLLMs) 的基准. 虽然一些MLLM在单个图像上表现良好,但只有GPT-4V在对对比中表现出色,反映了人类的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 多模式大语言模型 (MLLMs) 正在推进计算机视觉.
- 评估低水平视觉感知和理解的MLLM是一个未被充分探索的领域.
- 目前的基准并没有充分评估MLLM在细微的低级视觉任务中的能力.
研究的目的:
- 建立基准设置来评估低水平视觉感知和描述中的MLLM.
- 评估MLLM对低级别视觉属性进行对对比的能力.
- 为了评估MLLM在预测图像质量得分方面的表现,根据人类的判断.
主要方法:
- 开发低水平视觉感知 (A1) 和描述 (A2) 的基准设置.
- 创建LLVisionQA+和LLDescribe+数据集,用于单个和配对的图像评估.
- 使用基于软max的方法来评估MLLM的图像质量评估 (A3) 能力与7个IQA数据集中的人类意见.
主要成果:
- 24名MLLM的低水平视觉理解得到了评估.
- 几位MLLM在单个图像上的低水平视觉任务中表现出了能力.
- 只有GPT-4V在对照比较中与单图像评估相比显示出更高的准确性,与人类性能保持一致.
结论:
- 现有的MLLM在基本的低级视觉任务中表现有前途,但在比较判断方面扎.
- 双对比是一种更有效的方法来评估MLLM的低水平视觉感知,类似于人类的评估.
- 开发的基准和数据集旨在促进进一步研究低水平视觉中MLLM能力.


