聊天GPT与顾问:对回答耳鼻喉科病例问题进行盲目评估
Christoph Raphael Buhr1,2, Harry Smith3, Tilman Huppertz1
1Department of Otorhinolaryngology, University Medical Center of the Johannes Gutenberg-University Mainz, Mainz, Germany.
JMIR medical education
|December 5, 2023
概括
像ChatGPT这样的大型语言模型越来越多地用于医疗信息,但提供的答案不如医疗顾问那么准确和简洁. 虽然作为工具是有用的,但依靠它们来解决医疗问题可能会由于掩盖的赤字导致错误信息.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 耳鼻喉科 耳鼻喉科 耳鼻喉科
背景情况:
- 大型语言模型 (LLM) 正在成为补充医疗信息来源.
- 对个人医疗症状的患者咨询LLM正在增加.
- 这一趋势需要在临床环境中评估LLM的表现.
研究的目的:
- 评估ChatGPT在回答耳鼻喉科 (ORL) 病例问题方面的准确性.
- 将ChatGPT的答案与ORL顾问的答案进行比较.
- 分析LLM能力的演变 (ChatGPT 3和ChatGPT 4).
主要方法:
- 从医学研究材料中使用了41个基于案例的ORL问题.
- 收集了ORL顾问和ChatGPT (版本3和4) 的答案.
- 通过使用利克特尺度和盲目识别对医疗充分性,简洁性,连贯性和可理解性进行评估.
主要成果:
- 在所有类别 (P<.001) 中,ORL顾问的答案被评为明显更高 (P<.001).
- 聊天GPT的响应虽然在语义上很强,但显示出较低的医疗充分性和简洁性.
- 咨询师在98.4%的案例中正确识别了ChatGPT生成的答案;ChatGPT的答案要长得多.
结论:
- 聊天GPT的医疗充足性和简洁性落后于专家顾问.
- 虽然LLM显示出作为辅助工具的潜力,但却存在错误信息的风险.
- 高语义质量的LLM答案可以掩盖关键的上下文缺陷.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天 在GPT 聊天法学士 (LLM) 是一个专业.在法律上,LLMs.一个ORLRLRL.人工智能的人工智能是人工智能.聊天机器人 聊天机器人聊天机器人聊天机器人聊天机器人数字健康数字健康全球卫生健康全球卫生健康语言模型语言模型大型语言模型.低收入和中等收入国家.耳鼻喉科 耳鼻喉科 耳鼻喉科远程医疗服务是远程医疗服务.远程医疗远程医疗更多相关视频
05:04Author Spotlight: Evaluating Clinicians' Adoption of Ultrasound-Guided Vascular Cannulation Through Simulation Training
Published on: August 9, 2024
954
13:44Project-Based Learning Guidelines for Health Sciences Students: An Analysis with Data Mining and Qualitative Techniques
Published on: December 9, 2022
3.6K
