大型语言模型与传统教科书对比:优化塑性手术学习 病例准备
Chandler Hinson1,2, Cybil Sierra Stingl3, Rahim Nazerali3
1Frederick P. Whiddon College of Medicine, University of South Alabama, 5851 USA North Drive, Mobile, AL, 36688, USA. csh2121@jagmail.southalabama.edu.
BMC medical education
|July 2, 2025
概括
大型语言模型 (LLM) 提供了全面的外科教育内容,但需要提高简洁性和准确性. 聊天GPT在总体上表现优于双子座,突出了用于整形外科培训的AI工具的变化.
科学领域:
- 医学教育 医学教育
- 在外科手术中使用人工智能
- 整形和重建手术 整形和重建手术
背景情况:
- 大型语言模型 (LLM) 为外科教育提供了一种新的方法,提供交互式学习体验.
- 对LLM准确性,知识深度和潜在偏见的担忧需要严格的评估.
- 本研究评估了与传统教科书相比,LLM在塑性和重建性手术培训中的有效性.
研究的目的:
- 评估LLM (ChatGPT-4和Gemini) 在帮助外科实习生的有效性.
- 将LLM生成的内容与传统的案例准备教科书进行比较.
- 确定在外科教育中LLM改进的领域.
主要方法:
- 选择了六个代表性的整形和重建手术病例.
- 问题涵盖了临床解剖学,说明,禁忌和并发症.
- 医学专业人员使用5分利克特尺度对LLM和教科书的反应进行了评分.
主要成果:
- 法学士的答案比教科书更彻底,但不那么简洁.
- 教科书在禁忌和并发症方面优越.
- 聊天GPT被评为比双子座更准确,更彻底,更有用.
结论:
- 法律学历显示出产生全面教育内容的潜力,但需要提高简洁性和准确性.
- 聊天GPT总体上表现优于双子座,这表明了LLM的变化.
- 进一步的LLM发展对于可靠地融入医学教育至关重要.


