3DBench:用于对象和场景级指令调整3D大型语言模型的可扩展基准
Tianci Hu1, Junjie Zhang2, Yutao Rao1
1Key Laboratory of Specialty Fiber Optics and Optical Access Networks, Joint International Research Laboratory of Specialty Fiber Optics and Advanced Communication, Shanghai Institute of Advanced Communication and Data Science, Shanghai University, Shanghai, 200400, China.
本研究介绍了3DBench,这是使用3D点云数据评估多模式大语言模型 (MLLMs) 的新基准. 它提供了对MLLM空间感知和推理能力的更全面的评估.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 对于多模态大语言模型 (MLLMs) 的现有基准缺乏对3D点云数据集成的全面评估.
- 目前的评估往往侧重于对象级分类和场景标题,未能捕捉微妙的空间感知和推理技能.
研究的目的:
- 引入3DBench,这是一个新的,细粒度的基准,用于用3D点云数据评估MLML.
- 开发一种可扩展的方法,从模拟环境中创建3D指令调整数据集.
- 为评估MLLM表达,感知和推理能力提供一个全面的框架.
主要方法:
- 开发了3DBench,这是一个具有对象和场景级别的十项任务的基准,分为表达,感知和推理.
- 创建了一个大规模的3D指令调整数据集,包含来自模拟的超过239k个问题答案对.
- 引入了Bench模型,集成了先进的检测模型,以提高MLLM在3D任务上的性能.
主要成果:
- 拟议的3DBench基准和数据集可以更彻底地评估MLLM的3D理解.
- 通过集成先进的检测模型,Bench模型显示了显著的性能改进.
- 对比分析揭示了不同MLLM架构,培训和数据集的影响.
结论:
- 3DBench解决了当前针对使用3D点云数据的工作MLLM的基准标准的局限性.
- 该研究提供了一个强大的框架和数据集,用于推进对3D感知MLLM的研究.
- 研究结果为当前研究局限性和3D环境中MLLM开发的未来方向提供了关键的视角.
更多相关视频
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
05:15The Spatial Memory Game: Testing the Relationship Between Spatial Language, Object Knowledge, and Spatial Cognition
Published on: February 19, 2018
相关概念视频
Improving Translational Accuracy
Modeling and Similitude
Introduction and Methods of Leveling
Scaling
Calibration Curves: Linear Least Squares
For data that follow a straight line, the standard method for fitting is the linear...
Estimation of the Physical Quantities
