一个结构化的评估的LLM生成的逐步指令在尸体手臂解剖的尸体手臂解剖
Fulya Temizsoy Korkmaz1, Fatma Ok2, Burak Karip2
1Department of Anatomy, Hamidiye Faculty of Medicine, University of Health Sciences, Istanbul, 34668, Türkiye. fulya.temizsoykorkmaz@sbu.edu.tr.
BMC medical education
|July 2, 2025
概括
大型语言模型 (LLM) 显示出对尸体解剖的教育工具的希望,ChatGPT-4o和Grok 3.0在科学准确性和指导方面表现出色. 这些人工智能系统为可扩展,个性化的解剖训练提供了潜力,特别是在资源有限的环境中.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 解剖学剖析的解剖方法
背景情况:
- 大型语言模型 (LLM) 越来越多地用于各种医学领域.
- 它们在感官运动交互环境中的表现,如尸体解剖,仍然没有得到评估.
- 臂裂解剖对于人工智能指导来说是一个复杂的解剖挑战.
研究的目的:
- 为了比较分析LLM在尸体解剖中的表现.
- 评估学术质量,教育价值和LLM答案的可读性.
- 评估LLM作为复杂解剖环境中的逐步指南.
主要方法:
- 开发了一个28项问题集,用于手臂解剖.
- 经验丰富的解剖学家用修改的DISCERN和全球质量评分盲目评估了LLM反应.
- 通过Flesch阅读方便度,Flesch-Kincaid等级水平,SMOG,炮雾和科尔曼-利亚乌指数评估可读性.
- 通过ICC和Cohen's Kappa使用内容有效性指数和评级者之间的可靠性来验证内容.
主要成果:
- 聊天GPT-4o和Grok 3.0在科学准确性和指导结构方面获得了最高分 (p < 0.01).
- 深度搜索显示了高可读性,但缺乏内容深度;双子座的表现适度.
- 可读性指标与整体质量评分有显著的相关性.
结论:
- LLM可以为解剖学培训提供可扩展的,个性化的支持,补充传统方法.
- 这项研究是人工智能辅助尸体研究和外科解剖学决策支持的基础参考.
- 在资源有限的教育环境中,LLM显示出潜力,解决指导或尸体可用性挑战.


