大型语言模型在提供肝硬化相关信息方面的实际表现:一项比较研究
Yanqiu Li1, Zhuojun Li2, Jinze Li3
1Center for Integrative Medicine, Beijing Ditan Hospital, Capital Medical University, Beijing, China.
International journal of medical informatics
|May 7, 2025
概括
大型语言模型 (LLM) 对肝硬化信息有希望,但准确性和可读性各不相同. 聊天GPT在准确度方面表现出色,而双子座提供了更高质量的信息,表明了以患者为中心的医疗资源的潜力.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 患者教育 患者教育
背景情况:
- 患者越来越多地依赖在线资源来治疗肝硬化.
- 需要评估大型语言模型 (LLM) 在专业医疗领域的实际性能.
研究的目的:
- 评估四个主流LLM (ChatGPT-4o,Claude-3.5 Sonnet,Gemini-1.5 Pro,Llama-3.1) 在回答肝硬化相关问题的表现.
- 评估这些LLM的信息质量,可读性,准确性,简化能力和自我纠正能力.
主要方法:
- 使用了一套39个关于肝硬化问题的问题.
- 使用"为患者提供质量信息"工具评估信息质量.
- 通过Flesch-Kincaid指标评估可读性和通过共识评分评估准确性.
- 检查了简化和自我纠正能力.
主要成果:
- 在LLM中观察到显著的绩效差异;双子座在信息质量方面领先.
- 所有的LLM都需要大学水平的阅读理解能力,但表现出强大的简化能力.
- 聊天GPT获得了最高的准确性 (80%),其次是克劳德 (72%),拉玛 (64%) 和双子座 (49%).
- 所有模型都显示了自我纠正能力,提高了提示的准确性.
结论:
- LLM显示出产生肝硬化健康信息的巨大潜力.
- 质量,可读性和准确性的差异需要进一步研究.
- 提高医疗保健中的LLM价值对于可靠,以患者为中心的信息传播至关重要.


