探索大型语言模型对B型肝炎感染相关问题的性能:一项比较研究
Yu Li1,2, Chen-Kai Huang1, Yi Hu1
1Department of Gastroenterology, Jiangxi Provincial Key Laboratory of Digestive Diseases, Jiangxi Clinical Research Center for Gastroenterology, Digestive Disease Hospital, The First Affiliated Hospital, Jiangxi Medical College, Nanchang University, Nanchang 330006, Jiangxi Province, China.
World journal of gastroenterology
|January 22, 2025
概括
大型语言模型 (LLM) 在回答乙型肝炎病毒 (HBV) 问题方面显示出潜力,ChatGPT-4.0在客观查询中显示出更高的准确性. 然而,LLM产生的内容可读性超过了一般人群的水平.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 肝病学 肝病学是一种肝病学.
背景情况:
- 乙型肝炎病毒 (HBV) 感染需要持续,个性化的患者管理.
- 大型语言模型 (LLM) 为向患者传播医疗信息提供了一个潜在的途径.
研究的目的:
- 评估ChatGPT-3.5,ChatGPT-4.0和Google Gemini在响应B型肝炎病毒 (HBV) 相关查询时的准确性和可读性.
- 评估不同LLM在提供与HBV患者护理相关信息方面的表现.
主要方法:
- 三个LLM (ChatGPT-3.5,ChatGPT-4.0,谷歌双子) 被询问了与HBV相关的问题.
- 两名医疗专业人员对答案的准确性进行了评估,第三名审查员解决了差异.
- 使用枪雾指数和Flesch-Kincaid等级水平来评估可读性.
主要成果:
- 所有的LLM在主观HBV问题上都取得了高准确度 (平均分数>3.50/4).
- 在客观问题上,ChatGPT-4.0 (80.8%) 的表现优于Google Gemini (73.1%) 和ChatGPT-3.5 (62.9%).
- 在LLM的回答中,可读性得分明显高于人口平均阅读水平.
结论:
- LLM,特别是ChatGPT-4.0,显示出作为HBV患者和医生补充信息资源的希望.
- 虽然LLMs对于信息传播有价值,但不应取代专业的医疗建议来管理HBV.
- 需要进一步开发,以提高LLM产生的健康信息的可读性.


