评价Ptosis相关调查的大型语言模型:一个跨语言研究
Ling-Han Niu1, Li Wei2, Bixuan Qin3
1Beijing Tongren Eye Center, and Beijing Ophthalmology Visual Science Key Lab, Beijing Tongren Hospital, Capital Medical University, Beijing, People's Republic of China.
Translational vision science & technology
|July 16, 2025
概括
像GPT-4o这样的大型语言模型 (LLM) 显示出对死问题的强大表现,改善了患者教育和临床医生的支持. Qwen2.5在中文清晰度方面非常出色,突出了临床使用前需要验证的必要性.
科学领域:
- 人工智能在医学中的应用
- 眼科 眼科研究 眼科研究
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医疗保健应用.
- 便秘症的调查要求患者和临床医生都提供准确,明确和富有同情心的反应.
- 跨语言能力对于全球医疗保健的可访问性至关重要.
研究的目的:
- 评估GPT-4,GPT-4o,Qwen2和Qwen2.5在解决与死相关问题的表现.
- 评估这些LLM的跨语言适用性和以患者为中心的评估能力.
- 在以患者为中心和以临床医生为中心的调查中比较LLM的表现.
主要方法:
- 收集了11个以患者为中心和50个以临床医生为中心的质问题.
- 使用准确性,充分性,清晰性,深度,帮助性和同情心等标准评估LLM响应.
- 进行了30名患者和8名眼科外科医生的临床评估,使用5分利克尔特度量表.
主要成果:
- 对于临床医生的问题,GPT-4o在整体性能和完整性方面表现优于Qwen2.5.
- 对于患者的问题,GPT-4o在帮助度方面得分更高,在清晰度或同理心方面没有显著差异.
- 与英语相比,Qwen2.5在中文表现出更高的清晰度.
结论:
- LLM,特别是GPT-4o,显示出与死相关的调查的巨大潜力,提供了有价值的见解.
- Qwen2.5显示了对中文语言支持的承诺,表明了多语言的优势.
- 在临床部署LLMs之前,需要进一步验证,领域特定的培训和文化适应.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
587
07:36Eye Tracking During Visually Situated Language Comprehension: Flexibility and Limitations in Uncovering Visual Context Effects
Published on: November 30, 2018
15.8K
