与手术手中的其他在线信息相比,评估聊天GPT响应的可用性
Ophelie Z Lavoie-Gagne1, Oscar Y Shen1, Neal C Chen1
1Harvard Medical School, Boston, MA, USA.
概括
与谷歌相比,ChatGPT提供了可靠但不易阅读的医疗信息. 快速工程可以提高可读性,但需要健康素养,这对访问在线健康信息构成了障碍.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 健康信息 可访问性 医疗信息 可访问性
背景情况:
- 一个自然语言处理工具ChatGPT有可能提高健康信息的可访问性.
- 评估手术主题在线医疗信息的可用性至关重要.
- 评估医学共识对信息可用性的影响是很重要的.
研究的目的:
- 评估手术主题在线医疗信息的可用性.
- 评估医学共识对在线医疗信息可用性的影响.
- 为了比较谷歌的可读性,可靠性和准确性,ChatGPT-3.5和ChatGPT-4.0用于医疗查询.
主要方法:
- 在谷歌,ChatGPT-3.5和ChatGPT-4.0.0中,三个医疗短语 (高,中等,低共识) 每个被查询了20次.
- 可读性是根据年级级别进行评估的;可靠性和准确性是使用预先确定的标题进行评分的.
- 统计比较使用了曼-惠特尼U测试,其α值为0.05.
主要成果:
- 谷歌在中等至高共识主题 (8年级水平) 和ChatGPT (大学二年级水平) 之间展示了卓越的可读性.
- 尽管具有相似的可靠性,但ChatGPT-4在低共识主题上的可读性低于ChatGPT-3.5,尽管可靠性相似.
- 在来源之间没有发现准确度的显著差异;然而,在ChatGPT-4和谷歌之间,疾病原因和程序细节的覆盖范围不同.
结论:
- 聊天GPT的响应是可靠的,但比谷歌的医疗信息难以读取.
- 提示工程可以调整ChatGPT可读性,但需要健康素养,从而创建一个访问障碍.
- 医疗共识对两个平台的在线信息可用性产生影响;提供商必须认识到ChatGPT的局限性.


