评估和比较大型语言模型对视神经炎相关问题的反应
Han-Jie He1,2, Fang-Fang Zhao1, Jia-Jian Liang1
1Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong, Shantou, Guangdong, China.
Frontiers in medicine
|July 10, 2025
概括
大型语言模型 (LLM) 显示了视神经炎治疗的潜力. 与克劳德-2和ChatGPT-3.5相比,ChatGPT-4.0和谷歌巴德在回答患者问题方面表现出更高的准确性.
科学领域:
- 人工智能在医学中的应用
- 眼科医生 眼科 眼科
- 临床决策支持 临床决策支持
背景情况:
- 大型语言模型 (LLM) 正在成为潜在的临床咨询工具.
- 有限的研究存在于LLM性能对于特定条件,如视神经炎.
- 视神经炎患者可以从可访问的,AI驱动的信息和支持中受益.
研究的目的:
- 评估和比较四个领先的LLM聊天机器人的表现:Claude-2,ChatGPT-3.5,ChatGPT-4.0和谷歌巴德.
- 评估LLM对视神经炎相关查询的答案的准确性,全面性和可读性.
- 确定最适合的LLM协助视神经炎患者.
主要方法:
- 开发了一套精心策划的24个视神经炎问题.
- 三位眼科医生评估了LLM的准确性和全面性在三点尺度上.
- 答案的可读性是使用四个既定尺度来评估的.
主要成果:
- 聊天GPT-4.0 (7.62 ± 0.86) 和谷歌巴德 (7.42 ± 1.20) 的准确性明显高于克劳德-2 (6.44 ± 1.07).
- 聊天GPT-4.0 (62.5%) 和谷歌巴德 (58.3%) 的准确度评分为"优秀"的比例最高,超过了Claude-2 (29.2%) 和聊天GPT-3.5 (41.7%).
- 所有LLM的综合性得分是可比的;然而,所有答案都需要大学水平的阅读能力.
结论:
- 作为视神经炎的临床咨询工具,LLM-Chatbots显示出显著的希望.
- 在临床部署之前,性能变化需要进一步改进和强大的评估策略.
- 确保可靠和准确的LLM表现对于患者安全和有效的护理至关重要.


