神经眼科疾病中的大型语言模型:聊天GPT与Bard与Bing
Dong Hee Ha1, Ungsoo Samuel Kim2,3
1Department of Ophthalmology, Chung-Ang University Hospital, Chung-Ang University College of Medicine, Seoul 06973, Republic of Korea.
International journal of ophthalmology
|July 21, 2025
概括
与Bard和Bing相比,ChatGPT-4.0和ChatGPT-3.5等大型语言模型 (LLM) 在神经眼科中显示出优越的诊断能力. 这些先进的AI工具可以通过准确的信息和诊断来协助临床决策.
科学领域:
- 神经眼科神经眼科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学应用.
- 评估LLM在神经眼科等专业领域的表现对于了解其潜在的临床实用性至关重要.
研究的目的:
- 为了比较ChatGPT-3.5,ChatGPT-4.0,Bard和Bing在神经眼科中的诊断性能.
- 通过这些LLM来评估答案质量,响应速度和识别关键诊断关键词.
主要方法:
- 四个LLM (ChatGPT-3.5,ChatGPT-4.0,Bard,Bing) 在神经眼科病例上进行了测试.
- 评估标准包括诊断成功率,答案质量,响应速度和关键词识别.
- 评估的特定疾病包括视神经炎,非动脉炎前部缺血性视神经病变和勒伯遗传性视神经病变.
主要成果:
- 与Bard和Bing相比,ChatGPT-4.0和ChatGPT-3.5显示出更高的诊断成功率和更高的答案质量.
- 在最初的试验中,Bard未能提供诊断,而Bing在令人满意的标准中得分最低.
- 巴德的响应时间明显快于ChatGPT模型和Bing.
结论:
- 在神经眼科诊断任务中,ChatGPT-3.5和ChatGPT-4.0显著优于Bard和Bing.
- 这些发现表明,先进的LLM可以成为眼科临床决策支持的宝贵工具.
- 该研究强调了人工智能驱动的自由文本解释在帮助医疗专业人员方面的潜力.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
690
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
586
