关于早泄的数字对话:评估人工智能驱动反应的有效性
Hakan Anıl1, Mehmet Vehbi Kayra2
1Department of Urology, Faculty of Medicine, Istanbul Aydin University, Beşyol, İnönü Street. No: 38, Küçükçekmece, 34295, Istanbul, Turkey. hakananil@aydin.edu.tr.
International urology and nephrology
|March 20, 2025
概括
像Llama和Gemini这样的AI聊天机器人提供了比ChatGPT更高质量的早泄健康信息,尽管所有模型的可读性都相似. 拉玛在整体质量评估中得分最高.
科学领域:
- 医疗保健中的人工智能
- 数字健康信息质量 数字健康信息质量
- 医学自然语言处理 医学自然语言处理
背景情况:
- 人工智能聊天机器人的普及为健康信息传播提供了新的途径.
- 过早射精 (PME) 是一个常见的性健康问题,需要可靠的信息.
- 评估人工智能产生的健康内容的质量对于患者的安全和信任至关重要.
研究的目的:
- 评估和比较ChatGPT,双子座和拉玛关于早泄 (PME) 的反应的质量和可理解性.
- 确定哪个人工智能聊天机器人提供了最准确,最清晰和最可靠的关于 PME 的信息.
主要方法:
- 关于PME的25个常见问题 (FAQ) 采用了谷歌趋势和Semrush.
- 来自ChatGPT,Gemini和Llama的答案使用Flesch阅读易度 (FRES),Flesch-Kincaid等级水平 (FKGL),修改后的DISCERN (mDISCERN) 和确保患者质量信息 (EQIP) 评分进行分析.
- 进行了统计分析,以比较聊天机器人的可读性和质量指标.
主要成果:
- 在所有三种AI模型中,可读性得分 (FRES,FKGL) 是可比的.
- 拉玛显示了最高的平均EQIP分数 (72.2 ± 1.1),其次是双子座 (67.6 ± 4.5) 和ChatGPT (63.1 ± 4.9).
- 与ChatGPT (2) 相比,Llama和Gemini获得了较高的mDISCERN中位数 (3),这表明信息质量优越.
结论:
- 在讨论早泄时,AI聊天机器人表现出类似的可读性水平.
- 根据EQIP和mDISCERN的评估,Llama和Gemini在PME的回复中提供了优越的质量和可靠性,而不是ChatGPT.
- 需要进一步的研究来优化人工智能产生的健康信息,以提高准确性和患者理解度.


