诊断绩效的比较分析:根据LLaMA3对LLaMA2的差异诊断列表,用于病例报告
Takanobu Hirosawa1, Yukinori Harada1, Kazuki Tokumasu2
1Department of Diagnostic and Generalist Medicine, Dokkyo Medical University, Shimotsuga, Japan.
JMIR formative research
|November 19, 2024
概括
与LLaMA2相比,LLaMA3大型语言模型在生成医疗病例报告的差异诊断方面显著提高了诊断性能. 生成性人工智能的这一进步显示出提高临床决策支持工具的前景.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
背景情况:
- 生成型人工智能 (AI),特别是大型语言模型 (LLM),已经取得了快速进展.
- 广泛使用的是LLaMA系列车型,包括LLaMA2和最近的LLaMA3.
- 对LLaMA3更新对诊断性能的影响仍未得到充分记录.
研究的目的:
- 进行对LLaMA3和LLaMA2.2之间的诊断性能进行比较评估.
- 为了评估差异诊断列表的准确性,两种模型生成了医疗病例报告.
主要方法:
- 从美国病例报告杂志 (2022-2023) 中分析了392份病例报告.
- 在LLaMA3和LLaMA2中输入案例详细信息,提示和参数相同.
- 根据最终诊断在前10名和前5名差异中以及作为顶级诊断的纳入,评估诊断绩效.
主要成果:
- 在79.6%的病例中,LLaMA3将最终诊断列入前10大差异,显著超过LLaMA2的49.7% (P<.001).
- 在63%的案例中,LLaMA3获得了前5名,而LLaMA2只有38% (P<.001).
- 在33.9%的病例中,LLaMA3正确识别了顶级诊断,而LLaMA2的22.7% (P<.001).
结论:
- 与LLaMA2.2相比,LLaMA3显示出诊断性能在统计学上显著的改善.
- LLaMA3的整体诊断性能大约是LLaMA2.2的1.5倍.
- 虽然有望提高医疗诊断,但生成性AI工具需要对临床应用进行仔细的解释,并且尚未被批准用于此类用途.
关键词:
在这里,我们可以看到AIAIAI.法学士:诊断诊断的方法拉拉玛拉拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉在NLP中,我们使用了NLP.人工智能的人工智能是人工智能.案例报告案例报告临床决策 临床决策临床决策支持系统.决策是做出决策的过程.决策支持提供了决策支持.诊断 诊断 诊断 诊断 诊断 诊断生成型的人工智能生成型的人工智能 (GAI)大型语言模型.自然语言处理自然语言处理.

