从CT文本报告中利用大型语言模型进行准确的AO断裂分类,从CT文本报告中获得准确的AO断裂分类
Markus Mergen1, Daniel Spitzl2, Conrad Ketzer3
1Department of Diagnostic and Interventional Radiology, School of Medicine, TUM University Hospital, Technical University of Munich, 81675, Munich, Germany.
Journal of imaging informatics in medicine
|July 7, 2025
概括
大型语言模型 (LLM) 在放射学报告中显示了骨折分类的潜力. 聊天GPT-4o和AmbossGPT表现最好,但所有LLM都需要进一步改进以获得详细的亚型准确性.
科学领域:
- 放射学 放射学是一门学科.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 为分析复杂的放射学报告提供了潜力.
- 通过将诊断标准整合到分类中,LLM可以帮助临床医生.
- 严格的验证对于LLMs在先进放射学中的临床采用至关重要.
研究的目的:
- 评估四个LLM (ChatGPT-4o,AmbossGPT,Claude 3.5 Sonnet,Gemini 2.0 Flash) 在使用AO分类系统对骨折进行分类时的表现.
- 将这些LLM的准确性与CT报告的数据集进行比较.
- 在骨折分类中识别LLM的优点和局限性.
主要方法:
- 追溯分析292个虚假CT报告,其中包括310个骨折.
- 根据报告文本,LLM的任务是对AO骨折进行分类.
- 性能与地面真相标签相对衡量,并根据骨折类型和亚类型对准确性进行分析.
主要成果:
- 聊天GPT-4o (74.6%) 和AmbossGPT (74.3%) 的整体准确度最高.
- 克劳德 3.5 索内特 (69.5%) 和双子座 2.0 闪光 (62.7%) 的精度较低.
- 骨识别能力高 (90-99%),但骨折亚型分类准确性有限 (71-77%).
结论:
- LLM 显示了协助放射科医生进行初始骨折分类的潜力,特别是在大体积环境中.
- 目前的LLM性能对于详细的骨折亚型分类是不一致的.
- 在为高级诊断工作流进行广泛的临床整合之前,需要进一步的细化和验证.


