医生与大型语言模型聊天机器人对自闭症患者在网上提问的答案:跨部分比较分析
Wenjie He1,2, Wenyan Zhang3, Ya Jin4
1Tianjin University of Traditional Chinese Medicine, Tianjin, China.
Journal of medical Internet research
|April 30, 2024
概括
医生为中国的自闭症患者提供了优异的反应,尽管像ChatGPT这样的大型语言模型 (LLM) 显示出更高的同情心. 临床整合需要进一步的LLM研究.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 自闭症谱系障碍研究研究
背景情况:
- 有限的可行性研究存在于使用大型语言模型 (LLMs) 在中国的自闭症患者.
- 大多数医学LLM研究都专注于英语人口,忽视了其他主要语言.
研究的目的:
- 评估LLM聊天机器人 (ChatGPT-4和ERNIE Bot) 在处理中国背景下自闭症患者的询问方面的有效性.
- 为了比较LLM响应与人类医生响应.
主要方法:
- 数据来源于中国医疗咨询平台DXY (100个样本,239个问题).
- 答案是匿名的,随机的,并由3位首席医生对相关性,准确性,有用性和同理心进行评估.
- 质量评估使用了五分利克特级别.
主要成果:
- 总体而言,医生反应是最受欢迎的 (46.86%),其次是ChatGPT (34.87%) 和ERNIE Bot (18.27%).
- 医生和ChatGPT在相关性和准确性方面得分高于ERNIE Bot.
- 医生在有用性方面得分更高,而ChatGPT表现出卓越的同情心.
结论:
- 目前,医生对中国自闭症患者的反应优越.
- 在提供医疗指导和同情心方面,LLM显示出潜力,可能超过人类医生.
- 进一步的研究和优化是必要的,以有效的临床整合在不同的语言设置LLMs.


