神经符号大语言模型系统与人类专家在急性胆囊炎管理中的性能比较
1Department of Emergency Medicine, Etimesgut Sehit Sait Erturk State Hospital, Ankara 06790, Turkey.
Journal of clinical medicine
|March 14, 2026
概括
与人类专家相比,神经象征性大语言模型系统在治疗急性胆囊炎方面表现出更高的准确性. 这种人工智能工具显示出临床决策支持的潜力,增强了医生在胆囊疾病管理方面的专业知识.
科学领域:
- 人工智能在医学中的应用
- 医疗决策支持系统 医疗决策支持系统
- 胆囊疾病管理 胆囊疾病管理
背景情况:
- 大型语言模型 (LLM) 在医疗决策支持方面表现有前途,但它们在急性胆囊炎管理中的有效性尚未得到充分研究.
- 现有的研究缺乏对复杂的胆囊疾病的AI系统的全面评估.
- 需要人工智能工具,可以对急性胆囊炎等疾病一致应用临床指南.
研究的目的:
- 评估一种神经象征性LLM系统,用于治疗急性胆囊炎和胆囊疾病.
- 将LLM系统的诊断准确性与多个专业的人类专家医生进行比较.
- 根据标准化的临床指南 (东京指南2018) 评估LLM的表现.
主要方法:
- 一项多中心的横截面研究,使用30个基于病例的关于急性胆囊炎和相关胆囊疾病的问题.
- 一个神经符号LLM系统,与AI代理和神经符号推理集成,使用LangGraph v1.0.0.开发.
- 该LLM的表现与30名医生 (10名整形外科医生,10名急诊医生,10名胃肠科医生) 的表现进行了比较,使用来自2018年东京指南的基于共识的黄金标准.
主要成果:
- 神经象征性LLM系统的整体准确率为96.7%,显著超过一般外科 (82.3%),急诊医学 (71.0%) 和胃肠病学 (78.7%) 专家.
- 该LLM在所有临床类别和诊断,治疗和并发症/预后评估中表现出卓越的表现.
- 接收器操作特征 (ROC) 分析显示,与人类专家相比,LLM (AUC = 0.983) 的区别非常好.
结论:
- 与人类专家相比,神经象征性LLM系统在与指导方针一致的急性胆囊炎管理评估中表现出卓越的表现.
- 这种人工智能系统具有作为临床决策支持工具的潜力,增强医生专业知识,特别是在资源有限的环境中.
- 该研究强调了法学士课程对标准化指南的一致应用,尽管结果是基于结构化的案例评估.
