聊天机器人在早泄问题上的表现:可靠性,可读性和可理解性的比较分析
S Gonultas1, S Kardas2, M Gelmis2
1Gaziosmanpasa Training and Research Hospital, Department of Urology, Istanbul, Turkey. dr.serkangonultas@hotmail.com.
International journal of impotence research
|September 24, 2025
概括
人工智能聊天机器人提供有关早泄的可靠信息,但在可读性和来源验证方面存在困难. 为了更好地教育患者和将AI整合到医疗保健中,需要进行改进.
科学领域:
- 医疗保健中的人工智能
- 数字健康和医疗信息传播传播
- 性健康和人工智能应用
背景情况:
- 人工智能 (AI) 聊天机器人越来越多地用于健康信息.
- 早泄 (PE) 是一个常见的性健康问题.
- 评估AI在提供准确和可访问的PE信息方面的作用至关重要.
研究的目的:
- 评估人工智能聊天机器人关于早泄 (PE) 的反应的可靠性,可读性和可理解性.
- 评估AI在提供性健康信息方面的潜在贡献,风险和局限性.
- 为了比较多个AI聊天机器人 (Copilot,Gemini,ChatGPT4o,ChatGPT4oPlus,DeepSeek-R1) 在PE相关查询上的性能.
主要方法:
- 通过谷歌趋势确定了关于PE的15个常见问题,向五个AI聊天机器人提出.
- 使用全球质量表 (GQS) 来衡量可靠性.
- 使用Flesch Kincaid阅读方便度 (FKRE),Flesch Kincaid等级水平 (FKGL),枪击雾指数 (GFI) 和简单的Gobbledygook测量 (SMOG) 来评估可读性.
- 使用可打印材料的患者教育材料评估工具 (PEMAT-P) 评估可理解性.
- 还检查了引用来源的一致性.
主要成果:
- 与Copilot和Gemini相比,ChatGPT4o,ChatGPT4oPlus和DeepSeek-R1的可靠性 (GQS分数) 和可理解性 (PEMAT-P分数) 更高 (p < 0.001).与Copilot和Gemini相比,ChatGPT4o,ChatGPT4oPlus和DeepSeek-R1的可靠性和可理解性更高 (GQS分数) 和可理解性更高 (PEMAT-P分数).
- 所有聊天机器人在可靠性和可理解性方面都达到可以接受的水平 (≥70%).
- 所有聊天机器人的可读性得分都超过了目标受众推的水平,这表明了理解的潜在障碍.
- 发现了可靠性较低和未经验证的来源,聊天机器人之间没有显著差异.
结论:
- 人工智能聊天机器人通常提供有关早泄 (PE) 的可靠和信息化的答案.
- 存在显著的局限性,特别是关于答案的可读性和引用来源的验证.
- 需要进一步开发以优化人工智能生成的健康信息以提高清晰度和准确性,特别是对于像PE这样的敏感话题.
相关概念视频
Reliability and Validity
13.7K
Reliability and validity are two important considerations that must be made with any type of data collection. Reliability refers to the ability to consistently produce a given result. In the context of psychological research, this would mean that any instruments or tools used to collect data do so in consistent, reproducible ways.
13.7K
Self-Discrepancy Theory
18.9K
One influential perspective on what motivates people's behavior is detailed in Tory Higgin's self-discrepancy theory (Higgins, 1987). He proposed that people hold disagreeing internal representations of themselves that lead to different emotional states.
18.9K
