虚拟案例推理和人工智能辅助诊断指令:基于身体互动和大型语言模型的经验研究
Guihua Chen1,2, Chuan Lin3, Lijie Zhang2
1Department of Biomedical Sciences, Institute for Medical Science, Jeonbuk National University Medical School, Jeonju, Jeollabuk-do, Republic of Korea.
BMC medical education
|October 24, 2025
概括
这项研究比较了两种临床推理教育的大型语言模型 (LLM). 聊天GPT-4在中风病例和可读性方面表现出色,而DeepSeek-R1提供了一致的性能和语法精度.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 临床推理模拟临床推理模拟
背景情况:
- 与大型语言模型 (LLM) 集成的虚拟患者平台为临床推理教育提供了一种新方法.
- 这项研究评估了Body Interact与ChatGPT-4和DeepSeek-R1结合在急性护理环境中的性能和教育实用性.
研究的目的:
- 在虚拟患者模拟中评估和比较ChatGPT-4和DeepSeek-R1的诊断和治疗一致性,临床推理对齐和教育质量.
- 确定每个AI模型在医学教育中的不同学习目标中的优势.
主要方法:
- 模拟了三个标准化的急性护理场景 (昏迷,中风,创伤).
- 案例摘要被输入到ChatGPT-4和DeepSeek-R1中,使用相同的提示.
- 通过专家评分和AI自我评估,对诊断/治疗一致性,临床推理对齐,可读性和语法准确性进行了评估.
主要成果:
- 聊天GPT-4在中风情景中表现优越,但在昏迷和创伤病例中不同.
- 在所有模拟病例中,DeepSeek-R1提供了更一致的诊断和治疗输出.
- 两种模型都获得了高的专家和自我评估分数;ChatGPT-4产生了更易读的文本,而DeepSeek-R1显示了更好的语法精度.
结论:
- 聊天GPT-4和DeepSeek-R1对于人工智能辅助的医疗指导具有明显的优势.
- 聊天GPT-4的清晰语言可能会使新手学习者受益,而DeepSeek-R1的精度与正式的临床推理很好地一致.
- 根据特定的教育目标定制人工智能模型选择可以优化人工智能驱动的医学培训的有效性.


