对孕期糖尿病人工智能聊天机器人的有效性,可靠性和可读性的评估:多模型比较研究
Xinxin Wang1, Shuyan Lin1, Hui Liu1
1Department of Obstetrics, Shenzhen Nanshan Maternity and Child Healthcare Hospital, Shenzhen, China.
Frontiers in public health
|February 20, 2026
概括
人工智能 (AI) 聊天机器人在妊娠糖尿病 (GDM) 信息中显示出更高的准确性,新型模型的表现优于旧型. 然而,由于透明度和可读性问题,它们还不适合作为独立的患者教育资源.
科学领域:
- 医疗保健中的人工智能
- 医疗信息学医学信息学
- 公共卫生 公共卫生
背景情况:
- 孕期糖尿病 (GDM) 是一个日益严重的全球健康问题,对母亲和婴儿造成重大风险.
- 准确和可访问的健康信息对于管理GDM至关重要.
- 人工智能聊天机器人用于健康查询的使用正在增加,但它们与GDM相关的信息质量不确定.
研究的目的:
- 评估人工智能聊天机器人对妊娠糖尿病 (GDM) 信息的准确性,可靠性和可读性.
- 为了比较不同的人工智能模型和世代在GDM相关问题上的表现.
- 评估AI聊天机器人适用于GDM患者教育的适用性.
主要方法:
- 六个人工智能聊天机器人使用200个多选题 (MCQ) 对GDM进行了评估,涵盖流行病学,诊断,结果和管理.
- 通过谷歌趋势和专家审查确定了15个核心GDM教育问题,对4个聊天机器人进行了评估.
- 使用DISCERN,EQIP,GQS和JAMA基准评估可靠性;使用ARI,CL,FKGL,FRES,GFI和SMOG指数量化可读性.
主要成果:
- 聊天GPT-5展示了最高的MCQ准确性 (92.17%),新的模型始终优于旧的模型.
- 在面向公众的信息中,ChatGPT-5也获得了最高的可靠性得分,尽管JAMA得分表明透明度差.
- 所有聊天机器人都生成了超过推阅读水平的文本,ChatGPT-5具有最有利的,但仍然不足的可读性概况.
结论:
- 当前的人工智能聊天机器人通常提供准确和适度可靠的GDM信息,在新一代中有显著的改进.
- 有限的透明度和高的阅读水平意味着人工智能聊天机器人尚未成为GDM患者教育的理想独立资源.
- 人工智能聊天机器人应该补充,而不是取代,临床医生咨询和专业开发的GDM教育材料.

