使用多模式大语言模型进行自动抓获分类
Lina Zhang1, Richard Jiang1, Tonmoy Monsoor1
1Electrical and Computer Engineering, University of California, Los Angeles, California, USA.
medRxiv : the preprint server for health sciences
|November 24, 2025
概括
这项研究引入了一种新的多式大型语言模型 (MLLMs) 方法,用于自动抓获分析. 在使用视频数据区分发作 (ES) 和非发作 (NES) 方面,MLLM方法显示出前景.
科学领域:
- 神经学 神经学
- 人工智能的人工智能
- 医学成像分析 医学成像分析
背景情况:
- 将发作 (ES) 与非发作 (NES) 区分开来,在临床上是具有挑战性的,通常需要广泛的住院视频电脑电图 (EEG) 监测.
- 对视频的自动分析有可能简化诊断并降低医疗保健成本.
研究的目的:
- 开发和评估一种基于多模态大语言模型 (MLLMs) 的方法,用于从抓获视频中自动提取语义特征.
- 使用提取的特征将事件分类为ES或NES.
主要方法:
- 整合视觉语言模型 (VLM) 和音频语言模型 (ALM) 的MLLM框架被用于分析ES和NES事件的90个视频.
- 模型自动提取了24个临床相关的半理学特征,这些特征与专家注释进行了比较.
- 提取的特征被用来训练分类器 (KNN,XGBoost,深度分解机) 用于ES/NES差异化,使用离开一个患者的交叉验证.
主要成果:
- 通过KNN实现高性能 (精度为0.97,回忆为0.97,F1得分为0.97,AUC为0.99).
- 对于特征提取,MLLM管道的平均回忆率为0.71,平均准确率为0.58,平均F1得分为0.51.
- 使用MLLM提取特征的最佳KNN模型实现了0.77精度,回忆0.76,F1得分0.76和AUC0.76,正确识别了68/90事件.
结论:
- MLLMs可以从视频中切实提取临床相关的半理学特征,用于自动分析.
- 这种基于MLLM的方法提供了一种有希望的,临床上可解释的方法,以帮助使用视频录制来诊断.
更多相关视频
06:28Author Spotlight: Unraveling Seizure Dynamics and Novel Therapeutics for Status Epilepticus Using CMOS High-Density Microelectrode Array Systems
Published on: September 27, 2024
3.2K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1000
