用大型语言模型提高创伤选准确性:与人类专家决策的比较
Ascharya Kushidhan Balaji1, Brendan T Fox1, Philip Seger1
1Jacobs School of Medicine and Biomedical Sciences, University at Buffalo, Buffalo, NY.
Journal of the American College of Surgeons
|February 27, 2026
概括
大型语言模型 (LLM) 在改善儿科创伤分类准确性方面表现有前途. 虽然回顾性审查显示了与人类临床医生可比的性能,但需要进一步验证临床结果.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 创伤外科 手术 创伤外科
背景情况:
- 准确的医院前创伤分类对于患者的治疗结果和医疗保健系统的效率至关重要.
- 大型语言模型 (LLM) 为增强医院前创伤分拣过程提供了一个新的机会.
- 目前在医院前创伤护理中LLM的实施是有限的.
研究的目的:
- 评估LLM在儿科创伤分类中的表现.
- 为了评估LLM辅助的医院前电信的准确性.
- 为了比较LLM选准确度与人类临床医生的表现.
主要方法:
- 在一级中心对133例儿科创伤激活的回顾性队列研究.
- 对EMS录音,创伤页面和伤害严重程度得分 (ISS) 的分析.
- 利用OpenAI Whisper进行转录和命名实体识别 (NER) 进行结构化数据提取;前性评估涉及创伤外科医生.
主要成果:
- 在回顾性分析中,LLM分组显示了与人类临床医生相比的准确性 (83.5%与78.9%).
- 通过LLM辅助的分拣显示了减少不足分拣 (4.8%对5.1%) 的趋势,并显著减少过多分拣 (58.6%对71.8%).
- 展望评估表明,在LLM暴露后,人类选准确度有所提高,提高了正确选决策的几率.
结论:
- 在回顾性儿科创伤分类中,LLM的准确性与创伤工作人员的准确性相当.
- 使用结构化的"基本转录"显著减少了数据长度,同时保持了准确性.
- 进一步的研究对于验证LLM通用性,临床结果和用户接受广泛部署至关重要.
相关概念视频
Improving Translational Accuracy
3.7K
3.7K
Improving Translational Accuracy
15.3K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
15.3K

