评估大型语言模型的能力:GPT4在外科知识评估上的表现
Brendin R Beaulieu-Jones1,2, Sahaj Shah3, Margaret T Berrigan1
1Department of Surgery, Beth Israel Deaconess Medical Center, Boston, MA.
medRxiv : the preprint server for health sciences
|July 28, 2023
概括
人工智能 (AI) 在外科知识测试中表现强,但在重复查询时,ChatGPT的响应差异很大,这凸显了需要改善医疗保健中的AI一致性.
科学领域:
- 医学中的人工智能
- 医疗保健中的自然语言处理.
- 外科的教育和评估.
背景情况:
- 人工智能 (AI) 有潜力彻底改变医疗保健诊断和治疗.
- 一个大型语言模型ChatGPT在各种基准上展示了人类水平的性能.
- 这项研究调查了ChatGPT在手术病例问题上的性能和稳定性.
结论:
- 在手术领域,ChatGPT表现出强大的,接近人类水平的性能.
- 在重复查询时,观察到响应中的显著不一致性.
- 需要进一步的模型培训,以确保安全和一致的AI辅助临床护理.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
296
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.5K
