评估大型语言模型在当前程序术语编码中的准确性,在各种整形外科子专业中给定操作笔记模板
Mia J Carrarini1, Hilary Y Liu1, Catherine K Perez1
1Department of Plastic Surgery, University of Pittsburgh Medical Center, Pittsburgh, PA 15219, USA.
概括
大型语言模型 (LLM) 显示了在整形外科手术中自动化CPT编码的潜力,但准确性各不相同. 双子座和副驾驶员表现最好,尽管人类监督对于可靠的医疗编码至关重要.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 整形外科编码 整形外科编码
背景情况:
- 手动现行程序术语 (CPT) 编码耗时,增加了医疗保健中的行政负担.
- 大型语言模型 (LLM) 为自动化CPT代码生成提供了一个潜在的解决方案.
- 在从操作笔记中分配CPT代码时,LLM的准确性尚未得到充分证实.
研究的目的:
- 评估三个LLM (GPT-4,Gemini,Copilot) 在从整形外科手术笔记模板中生成CPT代码的准确性.
- 为了比较这些LLM在不同的整形外科子专业的表现.
主要方法:
- 使用了来自六个整形外科子专业的26个未识别的操作笔记模板.
- 一个标准化的提示函数被用来请求每个LLM的CPT代码.
- 模型输出与外科医生验证的代码进行比较,并将其分类为正确,部分正确或不正确.
主要成果:
- 在LLM之间观察到总体编码精度的显著差异 (p=0.02176).
- 双子座和Copilot表现出最高的准确率 (分别为19.2%),Copilot产生了更部分正确的输出 (53.8%). 最低的准确率是GPT-4 (7.7%).
- 双子座在整形外科 (60%的准确率) 中表现出色,而Copilot在一般重建 (42.9%) 中最准确. 没有模型准确地编码了乳房重建或面创伤.
结论:
- 虽然LLM显示了自动化CPT编码的潜力,但目前缺乏必要的上下文理解,以保持一致的准确性.
- 人类监督和持续的模型改进对于成功实施基于LLM的CPT编码系统至关重要.


