在自身免疫性疾病临床问题中的大型语言模型评估,比较ChatGPT 4o,Claude 3.5 Sonnet和Gemini 1.5 pro
Juntao Ma1, Jie Yu1, Anran Xie1
1Department of Laboratory Medicine, Nanjing Drum Tower Hospital Clinical College of Nanjing University of Chinese Medicine, Nanjing, Jiangsu, China.
Scientific reports
|May 21, 2025
概括
大型语言模型 (LLM) 在回答有关自身免疫性疾病的临床问题方面显示出强大的潜力. 克劳德3.5索内特在这些复杂的条件下,在准确性和完整性方面超过了其他模型和医生.
科学领域:
- 医疗人工智能 医疗人工智能
- 临床信息学 临床信息学
- 类风湿病学 类风湿病学
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地使用.
- 它们在回答复杂的临床问题上的有用性,特别是在自身免疫性疾病中,需要彻底评估.
研究的目的:
- 评估三个领先的LLM (ChatGPT 4o,Claude 3.5 Sonnet,Gemini 1.5 Pro) 在回答有关自身免疫疾病的临床问题的表现.
- 将LLM的反应与经验丰富的临床医生的评估进行比较.
主要方法:
- 为各种自身免疫性疾病开发了一套65个临床问题,涵盖五个领域 (概念,报告解释,诊断,治疗,预后).
- 八名临床医生通过相关性,完整性,准确性,安全性,可读性和简单性等标准来评估LLM生成的答案.
- 报告解释中的LLM准确性与初级和高级医生进行了具体比较.
主要成果:
- 这三位LLM在评估自身免疫性疾病的临床问题上,与初级和高级医生相比,都表现出更好的表现.
- 克劳德3.5索内特表现出了卓越的表现,提供了全面而准确的答案.
- 在帮助诊断,治疗和管理自身免疫性疾病方面,LLM显示出显著的潜力.
结论:
- 法学士,特别是克劳德3.5奏,非常有能力回答与自身免疫性疾病相关的临床问题.
- 这些发现凸显了LLM作为临床医生在管理自身免疫性疾病方面的宝贵工具的潜力.
更多相关视频
06:50A High-Throughput Electrochemiluminescence 7-Plex Assay Simultaneously Screening for Type 1 Diabetes and Multiple Autoimmune Diseases
Published on: May 29, 2020
2.4K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
474
