在手术评估问题上受过创伤训练的大型语言模型的表现:在资源识别方面的新方法
Arnav Mahajan1, Andrew Tran2, Esther S Tseng2
1Department of Surgery, The MetroHealth System, Case Western Reserve University School of Medicine, Cleveland, OH. Electronic address: https://twitter.com/arnavmahajan_.
Surgery
|September 24, 2024
概括
特定领域的大型语言模型 (LLM) 在外科教育中显示出前景. 根据创伤指南接受培训的定制LLM在板式问题上表现优于GPT-4,为外科培训提供准确和基于证据的答案.
科学领域:
- 医疗教育中的人工智能
- 在外科手术中的自然语言处理.
- 外科培训和评估的外科.
背景情况:
- 大型语言模型 (LLM) 在医学检查中取得了成功.
- 在外科教育中LLMs的应用仍然未被充分探索.
- 这项研究评估了LLMs的策划手术板式研究材料.
研究的目的:
- 评估外科教育中特定领域的LLM的有效性.
- 为手术板式问题开发和测试定制的LLM.
- 将LLM的表现与现有模型进行比较.
主要方法:
- 使用创伤外科手术指南开发了EAST-GPT和ACS-GPT.
- 评估了外科教育和自我评估计划中的创伤问题LLM.
- 评估答案的准确性,相关性,全面性,证据基础和清晰度.
主要成果:
- 东方-GPT达到76%的准确率;ACS-GPT达到68%的准确率.
- 这两种模型的性能明显优于GPT-4 (45%的准确性).
- 基于合理的理由,EAST-GPT在所有教育框架指标上表现出色.
结论:
- 特定领域的LLM可以接受培训,以生成准确,相关和基于证据的外科委员会考试的学习材料.
- 这种新的人工智能方法提高了测试准备资源.
- 在外科教育中进一步探索人工智能整合是有必要的.


