大型语言模型,人类专家和专家编辑的大型语言模型对神经眼科问题的比较研究
Prashant D Tailor1, Lauren A Dalvin, Matthew R Starr
1Department of Ophthalmology (PDT, LAD, MRS, DAT, KDC, MCB, SAM, JJC), Mayo Clinic, Rochester, Minnesota; Departments of Ophthalmology (HEM) and Neurology & Neurological Sciences (HEM), Stanford University, Palo Alto, California; Department of Ophthalmology (KEL, MWK, DDM), Glick Eye Institute, Indiana University School of Medicine, Indianapolis, Indiana; Ophthalmology Service (KEL), Richard L. Roudebush Veterans' Administration Medical Center, Indianapolis, Indiana; Department of Ophthalmology and Visual Sciences (KEL), University of Louisville, Louisville, Kentucky; Midwest Eye Institute (KEL), Carmel, Indiana; Circle City Neuro-Ophthalmology (KEL), Carmel, Indiana; Department of Neurology (MWK, DDM), Indiana University, Indianapolis, Indiana; Department of Ophthalmology (MADN, OMD), Mayo Clinic, Scottsdale, Arizona; and Department of Ophthalmology (MLP, ERE), Mayo Clinic, Jacksonville, Florida.
在神经眼科中,专家编辑的大型语言模型 (LLM) 响应获得了比人类专家单独获得的更高质量和同理心分数. 这表明,当专家对LLM进行改进时,它具有临床应用的巨大潜力.
科学领域:
- 医疗人工智能 医疗人工智能
- 临床信息学 临床信息学
- 神经眼科神经眼科
背景情况:
- 与人类专家相比,大型语言模型 (LLM) 在医学中的有效性尚未得到充分证实.
- 这项研究调查了由人类专家,LLM和专家增强的LLM在神经眼科中产生的反应的质量和同理心.
研究的目的:
- 为了比较人类专家,各种大型语言模型 (LLM) 和专家编辑的LLM输出响应的质量和同理心.
- 评估不同LLM (ChatGPT-3.5,ChatGPT-4,Claude 2,Bing,Bard) 在专业医疗领域的表现.
主要方法:
- 一项随机化,面具化,多中心的横截面研究,涉及13名神经眼科专家.
- 专家们回答了21个神经眼科问题,并编辑了ChatGPT-4的响应,记录了响应时间.
- 来自Expert + AI,人类专家和5名LLM的匿名响应被12名盲人质量和同理心 (1-5级) 专家评估.
主要成果:
- 专家+人工智能响应在质量 (4.16 ± 0.81) 和同理 (3.63 ± 0.87) 两方面都获得了最高分.
- 专家编辑的LLM响应在质量 (P < 0.0001) 和同理心 (P = 0.002) 方面明显优于人类专家响应.
- 聊天GPT-4和聊天GPT-3.5表现强,而Bard和Bing也表现出了竞争力的结果.
结论:
- 与人类专家相比,专家编辑的大型语言模型 (LLM) 响应显示出更高的质量和同理心.
- 这些发现支持进一步调查专家精炼的LLMs的整合,以加强神经眼科的临床实践.
更多相关视频
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
