评估用于疹管理的生成性AI大语言模型:对DeepSeek-R1和ChatGPT-4o进行比较分析
Mengyao Yang1, Jingchen Liang1, Luyue Zhang1
1Department of Dermatology, the Second Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China.
Clinical and translational allergy
|November 27, 2025
概括
在回答与疹相关的问题方面,DeepSeek-R1表现出了比ChatGPT-4o更好的性能,为医疗专业人员和寻求可靠健康信息的患者提供了更高的准确性和临床可行性.
科学领域:
- 人工智能在医学中的应用
- 皮肤病学 皮肤病学
- 自然语言处理自然语言处理.
背景情况:
- 疹是一种全球常见的健康状况,需要为患者和皮肤科医生提供准确,最新的信息.
- 现有的搜索引擎和人工智能模型往往提供低于最佳的或未经验证的医疗信息.
- 人工智能产生的医疗内容的可靠性,特别是对于像疹这样的疾病,需要进行彻底的调查.
研究的目的:
- 评估和比较两个领先的人工智能模型ChatGPT-4o和DeepSeek-R1在响应疹相关查询方面的表现.
- 根据关键标准评估人工智能产生的反应,包括简单性,准确性,专业性,临床可行性,可理解性和完整性.
主要方法:
- 使用e-Delphi程序创建和完善了一套全面的疹问题和评估框架.
- 聊天GPT-4o和DeepSeek-R1被提示这些问题,并收集了他们的答案.
- 67名参与者 (29名皮肤科医生,38名非皮肤科医生) 进行了单盲比较评估,评估了反应质量.
主要成果:
- 根据皮肤病学家的评价,DeepSeek-R1在多个指标上明显优于ChatGPT-4o,包括简单性,准确性,完整性,专业性和临床可行性.
- 非皮肤科医生发现DeepSeek-R1的反应更简洁,更易于理解.
- DeepSeek-R1提供了符合指导方针的无错误答案,而ChatGPT-4o在三个临床问题中存在错误.
结论:
- 严格评估人工智能产生的医疗内容对于确保在医疗保健中的可靠性和安全应用至关重要.
- 在临床和患者使用中,DeepSeek-R1比ChatGPT-4o具有更高的潜力,用于解决与疹有关的询问.
- 这些发现强调了选择和验证用于医疗信息传播的AI工具的重要性.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
3.2K
