大型语言模型的可行性,用于评估和指导外科医生的非技术技能
Marian Obuseh1, Sneha Singh2, Nicholas E Anton3
1Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN USA.
npj health systems
|July 18, 2025
概括
大型语言模型 (LLM) 现在可以使用机器人手术成绩单来评估和指导外科医生对非技术技能. 这项技术提供了可扩展的,数据驱动的外科教育和一致的指导实践.
科学领域:
- 医学教育 医学教育
- 在外科手术中使用人工智能
- 评估外科手术技能的评估
背景情况:
- 传统的外科非技术技能评估是主观的,资源密集的.
- 需要客观,可扩展的方法来评估和指导外科医生.
- 机器人辅助手术产生了适合分析的丰富数据.
研究的目的:
- 证明大型语言模型 (LLM) 在评估和指导外科医生的非技术技能方面的有效性.
- 探索LLM在分析外科成绩单以获得绩效反方面的能力.
- 建立LLM作为提高外科教育和指导一致性的工具.
主要方法:
- 使用Llama 3.1和Mistral大型语言模型.
- 分析了机器人辅助手术程序的成绩单.
- 在成绩单中确定了模范和非模范的外科行为.
- 为外科医生自动生成的结构化辅导反.
主要成果:
- LLM成功分析了手术成绩单,以确定关键行为.
- 准确区分了示范性和非示范性行为.
- 结构化,可操作的辅导反是自主生成的.
- 证明了LLM在客观技能评估方面的潜力.
结论:
- 大型语言模型显示出作为外科教育中的可扩展,数据驱动工具的巨大潜力.
- 法律士可以提供一致和客观的指导反,提高外科非技术技能.
- 这种方法提供了一种新的方法来加强外科医生的培训和绩效评估.


