评估高级大型语言模型在实验室医学中的适用性 测试问题:一项比较性能研究
Wenzheng Han1, Wenkai Zhu1, Gang Feng1
1Department of Clinical Laboratory, The First Affiliated Hospital, Wannan Medical College, Wuhu, Anhui, People's Republic of China.
Advances in medical education and practice
|March 2, 2026
概括
大型语言模型 (LLM) 在医学实验室科学教育中表现有前途. DeepSeek-R1表现出强的性能,在复杂问题的准确性和推理方面与人类专家相匹配或超过.
科学领域:
- 医学实验室科学 医学实验室科学
- 教育中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 显示了医学教育的潜力.
- 缺乏在医学实验室科学等专业领域的LLM的综合性绩效评估.
研究的目的:
- 评估医学实验室科学问题上的高级LLM.
- 评估LLM准确性,自然语言生成 (NLG) 质量,推理和效率.
主要方法:
- 与医学实验室科学家对比DeepSeek-R1,Gemini-2.5 Pro和GPT-5的多方面的评估.
- 从医学实验室测试库中利用了493个基于知识和推理的问题 (SCQ和MCQ).
- 通过精度,宏F1,响应时间,NLG分数 (ROUGE-L,METEOR) 和逻辑推理评估来衡量性能.
主要成果:
- DeepSeek-R1获得了78.3%的准确性,接近高级专家的表现 (79.3%).
- 在基于复杂推理的MCQ中,DeepSeek-R1表现出色 (准确率为64.4%),表现优于人类专家.
- DeepSeek-R1展示了优越的NLG质量和逻辑推理的全面性,整合了关键的诊断发现.
结论:
- 在特定的医学实验室任务中,DeepSeek-R1显示出与高级专家的性能相匹配或超过的潜力.
- 像DeepSeek-R1这样的LLM可以成为医学实验室科学教育和评估的有效工具.
- 对LLM效率和融入专业科学领域的进一步研究是有必要的.

