评估DeepSeek-R1用于多学科实验室医学中的临床决策支持
Qinpeng Li1, Lili Zhan1, Xinjian Cai1
1Department of Clinical Laboratory Medicine, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital & Shenzhen Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College, Shenzhen, Guangdong, People's Republic of China.
Journal of multidisciplinary healthcare
|August 18, 2025
概括
使用大语言模型 (LLM) 的人工智能 (AI) 在临床实验室医学中显示出前景. DeepSeek-R1在诊断假设中实现了72.9%的准确性,但在差异诊断方面需要改进.
科学领域:
- 人工智能在医学中的应用
- 临床实验室诊断 临床实验室诊断
- 医疗决策支持 医疗决策支持
背景情况:
- 人工智能 (AI) 的进步,特别是大型语言模型 (LLM),正在彻底改变医疗保健.
- 像DeepSeek-R1这样的LLM提供了在实验室医学中加强诊断决策和优化临床工作流程的潜力.
- 人工智能的整合旨在提高诊断准确性,支持临床判断,并完善患者护理策略.
研究的目的:
- 评估DeepSeek-R1大型语言模型在分析临床实验室病例中的性能.
- 评估DeepSeek-R1在生成诊断假设,差异诊断和诊断工作中的准确性和完整性.
- 确定DeepSeek-R1作为实验室医学中各种临床场景的决策支持工具的实用性.
主要方法:
- 从"临床实验室医学案例研究"中分析了100个临床实验室病例.
- 独立查询DeepSeek-R1每病例三次用于诊断,差异诊断和诊断测试.
- 高级临床实验室医生对人工智能产生的输出进行准确性和完整性的评估.
主要成果:
- DeepSeek-R1的整体准确率为72.9%,完成率为73.4%.
- 诊断假设 (85.7%) 的准确性最高,而差异诊断的准确性较低 (55.0%).
- 性能因疾病类别而异,在遗传和产科诊断方面取得了优异的结果 (准确率为93.1%).
结论:
- 在临床实验室医学中,DeepSeek-R1显示出作为诊断假设和工作建议的决策支持工具的潜力.
- 在产生差异诊断和处理临床细微差别方面存在局限性,需要进一步开发.
- 未来的研究应该专注于扩大培训数据,并纳入医生反,以提高现实世界的适用性.


