评估DeepSeek-R1作为患者教育工具的性能
Jiating Hu1, Junnan Wang2, Lu He3
1Department of Nursing, Second Affiliated Hospital of Naval Medical University, Shanghai, China.
Journal of medical systems
|November 10, 2025
概括
人工智能模型DeepSeek-R1显示了患者在腰部疼痛方面的教育潜力,提供了可以理解的信息,但由于可读性和偶尔的参考问题,需要仔细的临床审查.
科学领域:
- 医疗保健中的人工智能
- 医疗信息学 医疗信息学
- 患者教育 患者教育
背景情况:
- 腰部疼痛 (LBP) 是一个普遍的全球肌肉骨问题.
- 患者越来越多地使用人工智能聊天机器人,如大型语言模型 (LLM),以获取健康信息.
- 评估人工智能产生的健康信息的质量至关重要.
研究的目的:
- 评估DeepSeek-R1人工智能模型对LBP患者查询的响应质量和可读性.
- 评估人工智能生成内容的可理解性,可操作性,准确性和参考可靠性.
主要方法:
- 制定了十个常见的LBP问题,并输入到DeepSeek-R1.
- 使用多个标准指数 (Flesch-Kincaid,枪雾等) 评估可读性. ) 的情况.
- 使用PEMAT-P评估了可理解性和可操作性;临床医生评估涵盖了准确性,完整性和相关性;检查了幻觉的参考质量.
主要成果:
- 在所有可读性指标中,DeepSeek-R1的响应通常难以读取.
- 人工智能表现出良好的可理解性,但可操作性较弱.
- 临床医生发现信息准确,完整和相关,尽管14.8%的参考是幻觉.
结论:
- DeepSeek-R1具有作为对LBP患者教育的补充工具的潜力.
- 该模型的输出需要仔细的临床监督,不应取代专业的医疗判断.
- 需要进一步改进以提高可读性和减少参考不准确性,以实现最佳的患者使用.


