使用大型语言模型对黄蜂刺的临床管理:横截面评估研究
Wei Pan1, Shuman Zhang1, Yonghong Wang1
1Department of Emergency Medicine, Taihe Hospital, Hubei University of Medicine, Shiyan, Hubei, China.
Journal of medical Internet research
|June 4, 2025
概括
克劳德Pro和ChatGPT 4.0擅长管理黄蜂刺痛,为复杂的临床决策提供准确和全面的AI支持. 在这个领域,ERNIE Bot模型也显示了潜力.
科学领域:
- 人工智能在医学中的应用
- 毒理学 毒理学 毒理学
- 紧急医疗 紧急医疗
背景情况:
- 黄蜂刺对全球健康构成重大风险,从局部反应到危及生命的过敏反应.
- 黄蜂刺中的有毒化合物需要快速和明智的临床决策.
- 大型语言模型 (LLM) 正在成为医疗保健中临床决策支持的有价值的工具.
研究的目的:
- 评估和比较四个领先的LLM (ERNIE Bot 3.5,ERNIE Bot 4.0,Claude Pro,ChatGPT 4.0) 在处理黄蜂刺伤病例中的表现.
- 评估这些人工智能模型的准确性,全面性和临床决策能力.
- 确定最有效的LLM,以支持医疗保健专业人员在黄蜂的管理.
主要方法:
- 采用了横截面研究设计.
- 开发了50个标准化问题和20个临床案例场景,涵盖了10个黄蜂伤管理的关键领域.
- 八名领域专家使用5分利克特级别来评估LLM的答复,以确定准确性,完整性和有用性.
主要成果:
- 克劳德Pro获得了最高的平均专家评分 (4.7/5),其次是ChatGPT 4.0 (4.5/5).
- 在ERNIE Bot 4.0 (4.0/5) 和ERNIE Bot 3.5 (3.8/5) 中,性能较低.
- 在管理并发症和评估反应严重程度 (P<.001) 方面,Claude Pro显著超过了ERNIE Bot 3.5的表现. 专家评级显示中等程度的同意 (肯德尔W=0.67).
结论:
- 克劳德Pro和ChatGPT 4.0在为黄蜂伤管理提供准确和全面的临床支持方面表现出很高的能力,特别是在复杂的场景中.
- 这些发现凸显了人工智能在紧急医疗和毒理学领域日益增长的作用.
- 人工智能工具的选择应该与特定的临床需求保持一致,以便在医疗保健中获得最佳应用.


