评估用于内血管神经外科手术中自动化CPT代码预测的大型语言模型
Joanna M Roy1, D Mitchell Self1, Emily Isch2
1Department of Neurological Surgery, Thomas Jefferson University, Philadelphia, PA, USA.
Journal of medical systems
|January 24, 2025
概括
大型语言模型 (LLM) 可以从神经外科报告中识别当前程序术语 (CPT) 代码. 阿特拉斯GPT和ChatGPT的准确性高于双子座,这表明医疗保健成本降低的潜力.
科学领域:
- 人工智能的人工智能
- 神经外科 神经外科
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地用于医疗自动化,包括神经外科的临床文档.
- 准确的程序编码对于计费和医疗保健管理至关重要.
研究的目的:
- 评估三个LLM (ChatGPT 4.0,AtlasGPT和Gemini) 识别来自内血管神经外科手术报告中的当前程序术语 (CPT) 代码的能力.
- 为了比较这些LLM在CPT代码识别中的性能.
主要方法:
- 分析了30份内血管神经外科手术报告.
- 三名LLM的任务是识别诊断或干预程序的CPT代码.
- 回答被分为正确,部分正确或不正确.
- 统计测试 (奇方形,克鲁斯卡尔瓦利斯) 用于比较.
主要成果:
- 阿特拉斯GPT实现了98.3%的部分正确的CPT代码识别,其次是ChatGPT (86.7%) 和Gemini (30%).
- 对于完全正确的CPT代码,AtlasGPT的平均值为35.3%,ChatGPT为35.1%,而Gemini的平均值为8.9%.
- 在CPT代码识别准确度方面,AtlasGPT和ChatGPT显著优于Gemini.
结论:
- 未经培训的LLM在内血管神经外科中表现出识别部分正确CPT代码的能力.
- 进一步培训LLM可以提高CPT代码的准确性,并可能减少医疗保健支出.


