病毒性肝炎问题答案的比较评估:ChatGPT-4.5的表现优于三种已建立的模型
Juntao Ma1, Linyan Gong1, Yuchen Song2
1Department of Laboratory Medicine, Nanjing Drum Tower Hospital Clinical College of Nanjing University of Chinese Medicine, Nanjing, Jiangsu, China.
BMC medical informatics and decision making
|November 27, 2025
概括
聊天GPT-4.5在回答病毒性肝炎问题方面表现出色,优于其他AI模型. 这种先进的大型语言模型 (LLM) 为患者和医疗保健提供者提供可靠的信息,帮助他们管理这个全球健康问题.
科学领域:
- 人工智能在医学中的应用
- 公共卫生信息学 公共卫生信息学
- 自然语言处理自然语言处理.
背景情况:
- 病毒性肝炎对全球健康构成重大挑战,影响全球数百万人.
- 准确和可访问的信息对于公众的理解,预防和管理至关重要.
- 评估了四个大型语言模型 (LLM) 在病毒性肝炎查询中的表现.
研究的目的:
- 为了比较四个LLM (Gemini-2.0,Claude-3.5-sonnet,ChatGPT-4.5和ChatGPT-4) 在回答病毒性肝炎相关问题的表现.
- 评估LLM答案的准确性,相关性,全面性,安全性和可读性方面的差异.
- 确定最有效的LLM提供可靠的病毒性肝炎信息.
主要方法:
- 在南京鼓楼医院进行了一项比较评估研究.
- 使用了52个问题,涵盖了病毒性肝炎的概念,风险因素,诊断和治疗.
- LLM 答案最初以三分级评分,然后使用从 1 到 5 的评分标准进行进一步评估.
主要成果:
- 聊天GPT-4.5表现出最高的性能,其89.1%的响应被评为好.
- 聊天GPT-4.5显著超过了Claude-3.5-sonnet (71.15%),双子座-2.0 (62.82%) 和聊天GPT-4 (50.64%).
- 在所有评估标准中,ChatGPT-4.5始终获得最高分:相关性,全面性,准确性,安全性和可读性.
结论:
- 与其他三个评估模型相比,ChatGPT-4.5在解决病毒性肝炎查询方面表现出卓越的性能.
- 聊天GPT-4.5的高可靠性使其成为改善患者和非专业医疗保健专业人员信息可访问性的宝贵工具.
- 通过传播有关病毒性肝炎的准确信息,LLM在支持公共卫生工作方面表现有前途.


