对临床决策支持任务的ChatGPT,谷歌搜索和Llama 2进行系统分析
Sarah Sandmann1, Sarah Riepenhausen1, Lucas Plagwitz1
1Institute of Medical Informatics, University of Münster, Münster, Germany.
Nature communications
|March 6, 2024
概括
大型语言模型 (LLM) 显示了医疗咨询的潜力. 在诊断和检查方面,GPT-4的表现优于GPT-3.5和谷歌,尽管治疗的准确性各不相同.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 大众越来越多地使用大型语言模型 (LLM) 来寻找健康信息.
- 需要评估LLM在医疗应用中的临床准确性.
研究的目的:
- 评估GPT-3.5和GPT-4用于诊断,检查和治疗建议的临床准确性.
- 将LLM的表现与谷歌搜索和开源Llama 2模型进行比较.
- 确定医学问答中的LLMs的优点和弱点.
主要方法:
- 评估了110个不同的医疗病例.
- GPT-4,GPT-3.5和两个Llama 2配置的比较.
- 与对诊断准确性的天真谷歌搜索进行基准测试.
主要成果:
- 与GPT-3.5和谷歌搜索相比,GPT-4在诊断和检查方面表现优越.
- 所有评估的模型在常见疾病方面表现比罕见疾病更好,除了治疗.
- 在该子研究中,Llama 2模型的性能略低.
结论:
- 像GPT-4这样的商业LLM显示出医学问题答案的巨大潜力.
- 弱点突出了需要监管和强大的AI在医疗保健.
- 开源的LLM为数据隐私和培训透明度提供了潜在的好处.
更多相关视频
13:44Project-Based Learning Guidelines for Health Sciences Students: An Analysis with Data Mining and Qualitative Techniques
Published on: December 9, 2022
3.5K
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
15.9K
