结膜炎研究中的人工智能:通过幻觉率分析评估ChatGPT和DeepSeek的病因,干预和引用完整性
Muhammad Hasnain1, Khursheed Aurangzeb2, Musaed Alhussein2
1Department of Computer Science, Lahore Leads University, Lahore, Pakistan.
Frontiers in artificial intelligence
|September 5, 2025
概括
深度搜索提供了比ChatGPT更精确的结膜炎医疗信息, 克劳德在图像分类准确度方面表现出色, 超过了ChatGPT.
科学领域:
- 医学的人工智能
- 自然语言处理应用
- 医疗诊断
背景情况:
- 大型语言模型 (LLM) 在医疗保健方面具有前景.
- 评估LLM的诊断能力至关重要.
- 快速的工程提高了LLM的性能.
研究的目的:
- 将AI模型的诊断准确性进行比较 (ChatGPT,DeepSeek,Claude).
- 评估临床问题答案和图像分析的LLM.
- 调查快速工程对响应质量的影响.
主要方法:
- 使用ChatGPT和DeepSeek来回答临床问题.
- 采用ChatGPT,Claude,DeepSeek进行结膜炎图像分析.
- 应用快速工程和灵敏度分析.
主要成果:
- DeepSeek提供了更精确的结膜炎信息 (7%的幻觉与ChatGPT的13%).
- 克劳德在二进制图像分类中实现了100%的准确性,超过了ChatGPT的62.5%.
- 深度搜索显示图像数据集分析的局限性.
结论:
- 在基于文本的医疗查询中DeepSeek表现出色; 聊天GPT更适合一般信息.
- 克劳德在基于图像的诊断任务中表现出卓越的表现.
- 人工智能模型在医学诊断中具有潜力,但需要对特定应用进行仔细评估.


