从专家,专家编辑的大型语言模型或专家编辑的大型语言模型单独对视网膜问题的反应进行比较研究
Prashant D Tailor1, Lauren A Dalvin1, John J Chen1
1Department of Ophthalmology, Mayo Clinic, Rochester, Minnesota.
Ophthalmology science
|April 25, 2024
概括
专家编辑的大型语言模型 (LLM) 响应显示出高质量和同理心,与人类专家相美. 这表明LLM,当由专业人士精炼时,显示出眼科临床应用的希望.
科学领域:
- 眼科和人工智能的人工智能
- 医疗信息学 医疗信息学
- 在医疗保健中的自然语言处理.
背景情况:
- 患者教育在眼科中至关重要.
- 大型语言模型 (LLM) 提供了生成患者信息的潜力.
- 评估LLM产生的内容的质量,同理心和安全性至关重要.
研究的目的:
- 通过LLMs,人类专家和专家编辑的LLMs生成的对视网膜患者常见问题的质量,同理心和安全性进行比较.
- 评估专家编辑LLM答案的效率.
主要方法:
- 一项随机化,面具化,多中心研究,涉及13名视网膜专家.
- 专家们创建了原始响应,并编辑了LLM生成的响应 (专家+AI).
- 多个LLM (ChatGPT-3.5,ChatGPT-4,Claude 2,Bing,Bard) 产生了一些回应.
- 其他专家对质量,同理心和安全指标进行了评估.
主要成果:
- 专家+人工智能响应获得了最高的平均质量评分.
- 在同理心分数方面,GPT-3.5和专家+AI领先.
- 专家编辑的LLM响应在质量和同理心方面明显优于专家创建的响应.
- 通过专家+人工智能方法观察到显著的时间节约.
结论:
- 对于视网膜患者的问题,LLM的答案,特别是当专家编辑时,在质量,同理心和安全性方面与人类专家相美.
- 这些发现支持进一步调查在临床眼科环境中使用LLM.
- 专家精制的LLM提供了一个可行的工具,用于加强患者教育和信息传播.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
548
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
325
