基于大型语言模型的眼科写工具:使用模拟的临床遭遇进行性能和安全性评估
Minjie Zou1,2, Sahana Srinivasan1,2, Victoria Chin3
1Centre for Innovation and Precision Eye Health, Yong Loo Lin School of Medicine, National University of Singapore, Singapore, Singapore.
Eye (London, England)
|March 3, 2026
概括
海迪AI在六个LLM眼科笔记书写工具中以表现领先,但所有工具都有错误,需要人类监督以确保患者的安全.
科学领域:
- 眼科医生 眼科 眼科
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 基于六个大型语言模型 (LLM) 的写字工具被评估了它们生成眼科临床笔记的能力.
- 该研究的重点是模拟医生与患者接触中的性能和安全性.
研究的目的:
- 在生成眼科临床笔记时,比较六种基于LLM的写字工具的性能和安全性.
- 确定表现最好的工具,并评估这些AI书记者犯下的错误的类型和频率.
主要方法:
- 一项横截面比较研究使用了七个眼科遭遇,由六种写字工具转录.
- 咨询眼科医生使用医生文档质量仪器 (PDQI-9) 和文本生成指标 (ROUGE-L,BERTScore,BARTScore,AlignScore) 评估了笔记质量.
- 安全分析发现了文档错误,包括遗漏,不正确的信息和外部内容.
主要成果:
- 海迪AI获得了最高的整体文档质量 (PDQI-9:38.524) 并在准确性,有用性,组织性,全面性和简洁性方面领先.
- 海迪AI还在ROUGE-L (0.326),BERTScore (0.727) 和AlignScore (0.704) 中领先.
- 所有工具都显示出错误,主要是关键临床细节的遗漏,还包括不正确或外在的信息.
结论:
- 海迪AI在评估的LLM眼科文档编写工具中表现最高.
- 尽管性能充满希望,但所有工具都出现了错误,特别是关键细节的遗漏,这对患者的护理构成潜在风险.
- 在临床整合这些AI写字工具之前,人类监督和严格的验证是必不可少的.
更多相关视频
05:49Author Spotlight: Deciphering Electrical Networks Behind Complex Brain Activities and Disorders
Published on: November 1, 2024
1.2K
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
1.0K
