Q-BENCH:

概括

本研究介绍了评估低水平视觉任务中的多模式大语言模型 (MLLMs) 的基准. 虽然一些MLLM在单个图像上表现良好,但只有GPT-4V在对对比中表现出色,反映了人类的准确性.