大型语言模型的比较性能,用于患者主动的眼科咨询
Mingxue Huang1, Xiaoyan Wang1, Shiqi Zhou2
1School of Nursing, Southwest Medical University, Luzhou, China.
Frontiers in public health
|October 8, 2025
概括
大型语言模型 (LLM) 提供医疗建议,但性能各不相同. 对于寻求眼科信息的普通用户,ChatGPT-4o和DeepSeek-V3在准确性和一致性方面表现出色.
科学领域:
- 医疗保健中的人工智能
- 医疗信息学 医疗信息学
- 眼科医生 眼科 眼科
背景情况:
- 大型语言模型 (LLM) 越来越多地被公众用于医疗信息.
- 评估LLM对医疗建议的响应的可靠性至关重要.
研究的目的:
- 综合评估五个LLM在产生对眼科相关患者问题的答案方面的表现.
- 在准确性,逻辑一致性,连贯性,安全性和可访问性方面比较LLM性能.
主要方法:
- 31个常见的眼科患者问题被用于查询五个LLM:ChatGPT-4o,DeepSeek-V3,Doubao,Wenxin Yiyan 4.0 Turbo和Qwen.
- 通过五个领域的五分利克特级别来评估答案.
- 对文本特征 (字符,单词,句子数量) 进行了定量分析.
主要成果:
- 聊天GPT-4o和DeepSeek-V3显示了最高的整体性能,具有统计学上卓越的准确性和逻辑一致性.
- 杜巴奥和温信益扬4.0轮车表现出严重的安全缺陷.
- 与其他车型相比,Qwen产生的输出时间长得多.
结论:
- 对于寻求眼科信息的非专业人士来说,推使用ChatGPT-4o和DeepSeek-V3.
- 由于更丰富的临床术语,Doubao和Qwen可能更适合医疗培训的用户.
- 温信Yiyan 4.0 Turbo对于患者对诊断程序的理解是有效的.
- 需要进一步的研究,包括随机对照试验,以评估LLM在患者分拣中的整合.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.0K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
