对保护隐私的大型语言模型进行比较分析,用于自动心声回声分析报告分析
Elham Mahmoudi1,2, Sanaz Vahdati1, Chieh-Ju Chao1,2
1Department of Radiology, Radiology Informatics Lab, Mayo Clinic, Rochester, MN 55905, United States.
概括
开源大型语言模型 (LLM) 在解释心脏病 (VHD) 监测回声心脏图报告时显示了近乎完美的准确性. 使用思维链 (CoT) 的快速优化显著提高了性能,特别是在较大的模型中.
科学领域:
- 人工智能在医学中的应用
- 心脏病学 信息学 信息学
- 自然语言处理自然语言处理.
背景情况:
- 从心声回声图报告中自动提取数据对于大规模创建注册表和对膜心脏病 (VHD) 的临床监测至关重要.
- 评估由即时指令和思维链 (CoT) 指导的开源大型语言模型 (LLM) 的性能对于这项任务至关重要.
研究的目的:
- 评估开源LLMs在自动化对VHD监控的心声回声学报告的解释方面的有效性.
- 为了比较不同LLM的性能,并没有Cot提示分类VHD严重程度和假体门的存在.
主要方法:
- 利用2019年的200个随机回声心脏图报告进行快速优化,以及2023年的1000个用于评估.
- 采用了五个指令调整的LLM,以带有和没有CoT的快速指令为指导,以分类假体门的存在和VHD严重程度.
- 使用分类指标和平均平方误差 (MSE) 对专家标记的基本真相进行了绩效评估.
主要成果:
- 使用CoT提示的LLM实现了高精度:Llama3.0-70B (99.1%的VHD严重程度,100%的假) 和Qwen2.0 (98.9%的VHD严重程度,99.9%的假).
- 较小的模型对VHD严重程度的准确性较低 (54.1%-85.9%),但对假检测的准确性仍然很高 (>96%).
- 对于较大的模型,CoT推理提高了准确性,但增加了处理时间;错误主要是由于不相关的信息或未遵循说明.
结论:
- 开源的LLM在自动心声回声学报告解释方面表现出近乎完美的性能,促进了VHD注册表的形成和监控.
- 快速优化,特别是使用CoT,是实现较大模型高精度的关键.
- 将模型性能与计算效率相平衡,对于在临床环境中实际实施至关重要.


