评估大型语言模型在面外科手术中CPT编码的有效性:比较分析
Emily L Isch1, Advith Sarikonda2, Abhijeet Sambangi2
1Department of General Surgery, Thomas Jefferson University.
The Journal of craniofacial surgery
|September 2, 2024
概括
大型语言模型显示了外科手术现行程序术语 (CPT) 编码的前景. 虽然准确性各不相同,但人工智能聊天机器人为手动编码提供了一个资源高效的替代方案,特别是当它们配有操作笔记时.
科学领域:
- 医疗信息学 医疗信息学
- 在外科手术中使用人工智能
背景情况:
- 大型语言模型 (LLM) 正在推进外科学科.
- 人们越来越感兴趣在外科手术中使用LLM进行当前程序术语 (CPT) 编码.
- 手动CPT编码复杂,耗时,并且面临编码器短缺,需要创新的解决方案.
研究的目的:
- 评估公开可用的LLM在准确识别面手术CPT代码方面的有效性.
- 为了比较不同AI模型在CPT代码识别中的性能.
主要方法:
- 一项观察性研究评估了5个LLM:困惑.AI,巴德,BingAI,聊天GPT3.5和聊天GPT4.0.
- 使用了一致的查询格式,包括详细的程序组件.
- 针对已建立的CPT代码,回复被分类为正确,部分正确或不正确.
主要成果:
- 在AI模型类型和CPT代码正确性之间没有发现有意义的整体关联.
- 对于复杂的CPT代码,ChatGPT 4.0的准确性更高.
- 困惑.AI和Bard与简单的CPT代码显示出更大的一致性.
结论:
- 人工智能聊天机器人提供了一个有前途的,可访问的,资源高效的方法,用于在面外科手术中进行CPT编码,减少行政负担.
- 虽然准确性可能低于专业算法,但由于易于使用,LLM提供了一个有吸引力的替代方案.
- 用操作笔记启动人工智能模型可能会提高准确性,这表明了改善CPT编码工作流程的实用策略.


