四种大型语言人工智能模型的深入比较分析,用于风险评估和从多模式前列腺癌工作报告中检索信息
Lun-Hsiang Yuan1,2, Shi-Wei Huang2,3, Dean Chou1,4,5,6
1Department of Biomedical Engineering, National Cheng-Kung University, Tainan, Taiwan.
The world journal of men's health
|January 1, 2025
概括
在前列腺癌 (PC) 报告中评估了四种大型语言模型 (LLM) 信息检索和风险评估. 聊天GPT-4-turbo在风险评估中显示了最高的准确性,表明了临床决策支持的潜力.
科学领域:
- 医疗信息学 医疗信息学
- 在瘤学中使用人工智能
- 临床决策支持系统 临床决策支持系统
背景情况:
- 从多模式报告中准确的信息检索和风险评估对于有效的前列腺癌 (PC) 治疗至关重要.
- 大型语言模型 (LLM) 提供了自动化这些复杂任务的潜力.
研究的目的:
- 评估四个通用LLM在信息检索 (IR) 和风险评估 (RA) 任务中的表现,使用第四阶段PC的模拟临床数据.
- 为了比较ChatGPT-4-turbo,Claude-3-opus,Gemini-Pro-1.0和ChatGPT-3.5-turbo在处理不同临床数据方面的功能.
主要方法:
- 模拟的多模式报告 (CT,MRI,骨扫描,病理) 用于350名IV期PC患者.
- 在七个IR任务 (包括TNM分阶段) 和三个RA任务 (LATITUDE,CHAARTED,TWNHI) 上评估了四个LLM.
- 采用了零射击思维链提示和组合投票方法,三名评委的共识作为黄金标准.
主要成果:
- 在TNM分期中,LLM表现出高精度 (87.4%-94.2%) 和一致性 (ICC>0.8).
- 在RA性能中观察到显著差异,ChatGPT-4-turbo表现优于其他 (精度为90.1%-91.6%).
- 与单个查询相比,集体投票始终提高了准确性和可靠性.
结论:
- 在第四阶段的PC中,ChatGPT-4-turbo在RA和IR中表现出令人满意的性能,这表明它在临床决策支持中具有实用性.
- 尽管结果很有希望,但误解的可能性需要谨慎对待,并在各种瘤学环境中进一步验证.
更多相关视频
06:08A Cognitive Fusion-guided Prostate Biopsy Using Multiparametric Magnetic Resonance Imaging and Transrectal Ultrasound
Published on: March 21, 2025
104
13:19Microarray-based Identification of Individual HERV Loci Expression: Application to Biomarker Discovery in Prostate Cancer
Published on: November 2, 2013
16.5K
