大型语言模型用于从脑膜瘤手术中的操作报告中提取OPS代码
Sebastian Lehmann1, Florian Wilhelmy2, Nikolaus von Dercks3
1Department of Neurosurgery, University Hospital Leipzig, 04103, Leipzig, Germany. Sebastian.lehmann@medizin.uni-leipzig.de.
Acta neurochirurgica
|July 31, 2025
概括
大型语言模型 (LLM) 可以从外科报告中提取操作和程序编码系统 (OPS) 代码,但目前的专业编码器在准确性方面优于它们. 进一步培训可能使LLM能够与外科医生的表现相匹配,以实现最佳编码.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 外科手术程序编码的编码
背景情况:
- 德国的医疗计费系统依赖于操作和程序编码系统 (OPS) 代码来对DRG进行分组和收入确定.
- 准确的OPS代码分配对于医院报销至关重要.
- 本研究评估了大型语言模型 (LLM) 在从外科报告中推导OPS代码的有效性.
研究的目的:
- 评估GPT-4o和GPT CodeMedic在从外科报告中提取准确的OPS代码方面的能力.
- 为了比较LLMs与人类外科医生和专业编码员在OPS代码分配中的表现.
- 确定医学编码中LLM改进的潜在领域.
主要方法:
- 分析了100名脑膜瘤手术患者的匿名手术报告.
- 记录了外科医生和医院编码人员分配的OPS代码.
- GPT-4o和GPT CodeMedic的任务是使用当前的OPS目录提取OPS代码.
- 描述性分析和奇方位测试用于比较,以及错误评估.
主要成果:
- 专业编码人员实现了100%的足够编码准确性,明显超过了LLM (GPT-4o 78%,GPT CodeMedic 89%;p <0.01).
- 在最佳编码方面,编码者 (94%) 的表现优越,但GPT CodeMedic (83%) 的表现优于外科医生 (69%;p=0.03).
- 与GPT-4o (15%) 相比,GPT CodeMedic表现出更少的幻觉 (7%).
结论:
- 在提取OPS代码方面,LLM显示出潜力,错误往往是由于缺乏专业培训造成的.
- 专业编码人员目前提供更准确的足够和最佳编码.
- 在最佳编码方面,GPT模型显示了与外科医生相似的性能,表明了通过进一步培训实现任务自动化的未来潜力.
更多相关视频
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
45.8K
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.9K
