开发一款ICD-10编码助手:使用RoBERTa和GPT-4进行术语提取和基于描述的代码选择的试点研究
Sander Puts1, Catharina M L Zegers1, Andre Dekker1
1Department of Radiation Oncology (Maastro), GROW Research Institute for Oncology and Reproduction, Maastricht University Medical Centre+, P.O. Box 616, Maastricht, 6200 MD, Netherlands, 31 43 38 81863.
JMIR formative research
|February 12, 2025
概括
这项研究探讨了用于ICD-10编码的AI,发现主要术语提取有希望,但基于RAG的代码分配效率较低. 未来的工作应该更好地使人工智能与医疗编码器工作流程保持一致,以提高准确性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 世界卫生组织的国际疾病分类 (ICD) 为政策,研究和计费标准化了健康状况编码.
- 目前医疗编码中的AI自动化显示出希望,但落后于人类的准确性,并且缺乏临床采用的解释性.
研究的目的:
- 探索大型语言模型 (LLM) 的潜力,以协助医疗编码人员编码ICD-10.
- 开发一种计算机辅助的编码系统,通过识别领先术语和使用检索增强生成 (RAG) 来增强人类编码者.
主要方法:
- 利用CodiEsp-X数据集 (1000个西班牙临床病例具有ICD-10代码) 并通过使用GPT-4替换全文证据以领先术语来创建CodiEsp-X-lead.
- 微调了一个强大优化的BERT预训练方法 (ROBERTa) 模型用于命名实体识别以提取领先条款.
- 采用GPT-4来生成代码描述和RAG方法,使用OpenAI的文本嵌入-ada-002来通过矢量数据库分配ICD代码到领先的术语.
主要成果:
- 微调的ROBERTa模型在CodiEsp-X-lead数据集上实现了ICD引项提取0.80的F1得分.
- 由GPT-4生成的代码描述将RAG检索失败率降低约5%,用于诊断和程序.
- 对于CodiEsp-X任务的整体可解释性F1得分为0.305,明显低于最先进的状态 (0.633),这是由于依赖描述和工作流失调的原因.
结论:
- 主要术语提取显示出潜力,但基于RAG的代码分配使用GPT-4和描述被证明不那么有效.
- 未来的研究必须更好地将人工智能与医疗编码器工作流程相结合,包括官方编码指南和字母表索引,以提高准确性和实际实用性.


