拉玛3.1 405B可与GPT-4进行比较,用于从血栓切除报告中提取数据 - - 迈向安全数据提取的一步
Nils C Lehnen1, Johannes Kürsch2, Barbara D Wichtmann2
1Department of Neuroradiology, University Hospital Bonn, Rheinische Friedrich-Wilhelms-Universität Bonn, Venusberg-Campus 1, 53127, Bonn, Germany. nils.lehnen@ukbonn.de.
Clinical neuroradiology
|February 25, 2025
概括
大型语言模型 (LLM) 被评估用于提取机械血栓切除术数据. 拉玛3.1 405B的性能与GPT-4相当,为分析程序报告提供了潜在的更安全的离线替代方案.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 神经干预放射学神经干预放射学
背景情况:
- 大型语言模型 (LLM) 在从临床文本中提取程序细节方面表现有前途.
- 对于分析包含个人数据的报告,GPT-4的适用性是有限的.
- 需要具有离线能力的LLM来安全,高效地分析机械血栓切除报告.
研究的目的:
- 评估线下可操作的LLM (Llama3.1 405B,Llama3 70B,Llama3 8B,Mixtral 8X7B) 的数据提取能力,用于机械血栓切除报告.
- 在提取程序细节方面,比较这些LLM与GPT-4的性能.
- 评估LLM作为临床数据分析的数据安全替代方案的潜力.
主要方法:
- 使用了来自两个机构的130份自由文本机械血栓切除报告的数据集.
- 在德语和英语中采用了详细的提示.
- 使用McNemar的测试,LLM的性能与GPT-4进行了比较,由干预神经放射学家手动提取数据作为参考标准.
主要成果:
- 拉玛3.1 405B在数据提取中实现了93.5%的准确性,与GPT-4 (p=0.39) 在统计学上相当.
- 拉玛3 70B (英语提示:90.6%,德语提示:88.2%) 和Mixtral 8X7B (86.1%) 的准确性低于GPT-4 (p<0.001).
- 与GPT-4 (p<0.001) 相比,Llama 3 8B的准确性也较低 (86.1%).
结论:
- 在从机械血栓切除报告中提取程序数据时,Llama 3.1 405B的性能与GPT-4相当.
- 当Llama 3.1 405B在本地运行时,为分析此类报告提供了一个数据安全的替代方案.
- 该研究强调了特定的LLM在安全和高效的临床数据提取方面的潜力.


