大型语言模型的临床应用潜力:基于甲状腺结节的研究
Shujun Xia1,2, Qing Hua1, Zihan Mei1
1Department of Ultrasound, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, China.
Endocrine
|July 30, 2024
概括
像ChatGPT-3.5和New Bing Chat这样的大型语言模型 (LLM) 在甲状腺结节诊断中显示出潜力,但与医生的准确性不匹配. 临床决策能力需要进一步发展.
科学领域:
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 关于作为医生运作的大型语言模型 (LLM) 的数据有限.
- 在临床环境中研究了ChatGPT-3.5和New Bing Chat的性能.
研究的目的:
- 评估ChatGPT-3.5和新Bing聊天响应的准确性和可重复性.
- 用甲状腺结节作为模型,将LLM绩效与初级和高级医生进行比较.
主要方法:
- 145名甲状腺结节患者的问题被用于查询ChatGPT-3.5和New Bing Chat,每次5次.
- 研究人员将LLM的答案与5名初级医生和5名高级医生的答案进行了比较 (黄金标准).
- 评估了LLM生成答案的准确性和可重复性.
主要成果:
- 在特定问题上,ChatGPT-3.5和New Bing Chat的准确性低于初级医生 (Q2,Q3,Q5).
- 两位LLM在其他问题 (Q4,Q6) 上表现与初级医生相当.
- 新的Bing聊天 (72.41%) 在决策方面表现出比ChatGPT-3.5 (58.62%) 更高的准确性,但两者都落后于初级医生 (89.66%).
结论:
- 在甲状腺结节的诊断和管理中,LLM显示出医疗应用的希望.
- 目前的LLM没有人类医生的临床决策能力.
- 进一步的研究和开发是必要的,以弥合LLM能力和临床实践之间的差距.


