在中文眼科的大型语言模型的开发和评估
Ce Zheng1,2, Hongfei Ye1,2, Jinming Guo3
1Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine, Shanghai, China.
The British journal of ophthalmology
|July 17, 2024
概括
一个新的中国眼科大语言模型 (LLM) 在临床环境中显示出前景. 这个医学LLM在考试中表现相当于学员,并遵守了回答问题的指导方针.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 在医学上具有影响力,但缺乏领域特异性,以英语为中心.
- 一个中国特有的眼科LLM对中国的医疗保健提供者和患者至关重要.
- 现有的LLM没有满足中国医学语言和指导方针的细微差别.
研究的目的:
- 开发和评估一个名为MOPH的中国眼科大语言模型 (LLM).
- 评估MOPH在三个关键临床场景中的表现:董事会考试,基于证据的问答和诊断准确性.
- 将MOPH的能力与人类眼科医生的能力进行比较.
主要方法:
- 使用广泛的中国眼科公司开发了MOPH.
- 在中国眼科委员会考试和基于证据的医学问题上评估了MOPH.
- 评估了MOPH的诊断准确性,并将其性能与人类医生进行了比较.
主要成果:
- 在眼科考试中,MOPH的得分与实习生相当 (64.7比66.2),并且得分始终在60以上.
- 在回答问题时,MOPH表现出高度遵守 (83.3%) 中国眼科指导方针,答案最少是差的或不准确的.
- 在统计学上,MOPH的诊断准确度 (81.1%) 与人类眼科医生的诊断准确度 (96.1%) 不逊色.
结论:
- 开发的中国眼科LLM (MOPH) 在各种临床应用中显示出巨大潜力.
- MOPH在考试中表现出有前途的表现,在中国眼科背景下遵守指导方针和诊断准确性.
- MOPH已经准备好在中文眼科设置中进行现实应用,使专业人员和患者受益.


