在慢性疹中,ChatGPT-4反应的准确性有多高? 用信息质量指标进行批判性分析
Ivan Cherrez-Ojeda1,2,3,4, Marco Faytong-Haro2,5,6, Patricio Alvarez-Muñoz5
1Universidad Espíritu Santo, Samborondon, Ecuador.
The World Allergy Organization journal
|June 30, 2025
概括
这项研究发现,慢性疹 (CU) 护理的ChatGPT-4反应具有不可靠的信息和令人困惑的可读性,强调需要谨慎使用AI医疗建议.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 皮肤病学 皮肤病学
背景情况:
- 人工智能在医疗保健中的使用越来越多,人们对人工智能生成的医疗信息的准确性感到担忧.
- 这项研究专门评估了ChatGPT-4与慢性疹 (CU) 护理相关的反应.
研究的目的:
- 为了评估ChatGPT-4响应的质量,可靠性和可读性,用于慢性病 (CU) 管理.
- 评估ChatGPT-4的适用性,作为一个资源,在CU护理中获取医疗信息,遵守国际准则.
主要方法:
- 基于EAACI/GA2LEN/EuroGuiDerm/APAAACI建议的24个问题被用来激发ChatGPT-4.
- 过敏专家使用DISCERN,JAMA基准标准和Flesch可读性得分来评估反应.
- 用中位数计算和类内相关系数分析数据.
主要成果:
- 类别A (分类/诊断) 和C (治疗/管理) 的可靠性不足 (JAMA分数为1和0).
- B类 (评估/监测) 的可靠性较低 (中位数为2).
- 对于C类信息质量是令人满意的,但所有类别的可读性令人困惑 (Flesch分数).
结论:
- 聊天GPT-4显示出产生医疗内容的潜力,但对慢性病 (CU) 护理的可靠性不佳.
- 在使用人工智能生成的医疗信息时,特别是在管理CU时,谨慎和专家验证至关重要.


