相关实验视频
Updated: May 13, 2025

07:20
Inducement and Evaluation of a Murine Model of Experimental Myopia
Published on: January 22, 2019
9.8K
对近视的全球和中国域大语言模型的比较性能分析
Zehua Jiang1, Yueyuan Xu1, Zhi Wei Lim2,3
1Beijing Visual Science and Translational Eye Research Institute (BERI), Beijing Tsinghua Changgung Hospital Eye Center, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University, Beijing, China.
Eye (London, England)
|April 13, 2025
概括
全球和中国大语言模型 (LLM) 在回答近视问题方面表现强. 西方培训的法学士在中国环境中表现出色,证明了广泛的适用性.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 眼科医生 眼科 眼科
背景情况:
- 全球大型语言模型 (LLM) 的有效性在非西方医疗保健环境中仍然在很大程度上未被探索,主要是基于西方数据进行训练.
- 本研究调查了全球和中国领域的法学士在解决中国人口特有的近视相关问题方面的表现.
研究的目的:
- 评估和比较各种全球和中文域大型语言模型 (LLM) 的性能,以回答与中文特有的近视相关问题.
- 评估专业医疗领域LLM反应的准确性,全面性和同理心.
主要方法:
- 使用了一套多样化的全球 (ChatGPT-3.5,ChatGPT-4.0,谷歌巴德,拉玛-2 7B聊天) 和中国域名 (华图-GPT,MedGPT,阿里通义Qianwen,百度ERNIE Bot,百度ERNIE 4.0) 的法学士.
- 提示的LLM有39个中国特有的近视查询,跨越10个领域,由3位近视专家对准确性,全面性和同理心进行评估.
- 评估了LLM对"评级差"答案的自我纠正能力.
主要成果:
- 聊天GPT-3.5,百度ERNIE 4.0和聊天GPT-4.0获得了最高的准确度得分,超过94%的"好"响应.
- 聊天GPT-3.5,聊天GPT-4.0和百度ERNIE 4.0在他们的回复中表现出卓越的全面性和同理心.
- 百度ERNIE 4.0没有得到"糟糕"评级,所有其他LLM都显示出显著的自我纠正改进.
结论:
- 全球和中国领域的LLM都在回答与近视相关的问题方面表现出有效的表现,这些问题是根据中国的背景量身定制的.
- 全球LLM在中文语言环境中表现出了显著的有效性,即使主要以非中文数据和英语进行培训.

