对妇科癌症紧急护理的推理和非推理大语言模型的比较可行性
Junhwan Kim1, Uisuk Kim1, Jae Kyung Bae1
1Center for Gynecologic Cancer, National Cancer Center, Goyang, Republic of Korea.
BMC health services research
|November 25, 2025
概括
像GPT-4o这样的大型语言模型 (LLM) 在妇科癌症紧急护理中显示出可行性,显著提高了速度和准确性. 选择LLM应优先考虑医学知识,而不是模型版本,以获得最佳的临床支持.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 妇科瘤学 妇科瘤学
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床应用,包括决策和患者管理.
- 这项研究评估了LLMs在紧急妇科癌症护理中的可行性.
研究的目的:
- 评估生成预训练变压器 (GPT) -4o和o3-迷你高的性能,以支持妇科癌症患者的紧急护理.
- 在临床环境中比较LLM与人类医生的表现.
主要方法:
- 一个回顾性,单中心研究,涉及15个在妇科瘤学中的现实世界紧急病例.
- 两个LLM (GPT-4o,o3-mini-high) 和四名医生评估了诊断,治疗计划和患者教育方面的病例.
- 对答案的相关性和速度进行了评分;用于分析,使用了与引导绑定配对的测试.
主要成果:
- 与医生相比,这两种LLM都显著减少了评估时间 (约. 每个型号的300倍更快).
- 在总分数 (MD,3.55) 和在不包括速度指标 (MD,1.27) 中,GPT-4o的表现优于医生.
- o3-mini-high在总得分方面也超过了医生 (MD,3.05),对于LLM产生的管理,用户满意度很高.
结论:
- GPT-4o和o3-mini-high是紧急妇科癌症护理的可行工具.
- GPT-4o展示了潜在的优势,可能是由于该领域的紧急护理的基于模式的性质.
- 法学士的选择应侧重于特定领域的知识,而不是推理能力或模型版本;需要进一步的前性研究.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
475
