人工智能在产生结直肠外科手术问题板中的表现.
Jonathan Zuo1, Makenna Marty1, Seija Maniskas1
1Division of Colorectal Surgery, Huntington Health - an Affiliate of Cedars-Sinai, Pasadena, CA, USA.
American journal of surgery
|February 15, 2026
概括
大型语言模型 (LLM) 显示出潜力,但尚未可靠地创建高质量的结直肠外科手术委员会考试问题. 专家开发的问题在板式评估中明显优于LLM生成的内容.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 进行外科手术培训.
背景情况:
- 大型语言模型 (LLM) 证明了通过医疗执照考试的熟练程度.
- 法律士能够产生高质量的,板式的医学考试问题的能力在很大程度上仍未得到检查.
- 评估LLM产生的问题对于它们在医学教育中的潜在整合至关重要.
研究的目的:
- 为了评估结肠直肠外科手术的质量,由三个领先的法学士生成的板式考试问题.
- 将LLM生成的问题与已建立的教育材料进行比较.
- 为了确定LLM产生的问题是否适合董事会认证准备.
主要方法:
- 三个LLM产生了20个结肠直肠外科手术董事会问题,每一个,坚持美国结肠和直肠外科指导方针.
- 结肠和直肠外科教育计划 (CARSEP) 的问题被用作基准.
- 经过董事会认证的结肠直肠外科医生根据清晰度,相关性,适合性,分心质量和理由来评估问题,将其分类为"委员会批准"",作者审查"或"不接受".
主要成果:
- 卡塞普问题获得了最高的"委员会批准"率 (65%),明显超过了LLM (ChatGPT-4o: 7%,Copilot Pro: 10%,Gemini Advanced: 10%).
- 在大多数评估领域 (p < 0.001) 中,LLM显著超过CARSEP.
- 由LLM生成的问题在适合性方面获得了很高的评分 (>70%),这表明在特定方面有潜力.
结论:
- 当前的LLM并不总是能够产生高质量的,板式的结直肠外科手术考试问题.
- LLM 是有前途的,但需要进一步发展,以满足外科委员会考试的严格标准.
- 专家开发的问题库在董事会准备和评估方面仍然优越.


