大型语言模型如何回答乳腺癌测试题? 一项对GPT-3.5,GPT-4和谷歌双子座的比较研究
Giovanni Irmici1, Andrea Cozzi2, Gianmarco Della Pepa3
1Breast Radiology Department, Fondazione IRCCS Istituto Nazionale dei Tumori, Via Giacomo Venezian 1, 20133, Milano, Italy. irmici.giovanni25@gmail.com.
La Radiologia medica
|August 14, 2024
概括
大型语言模型 (LLM) 在乳腺癌治疗中显示出潜力. 在回答乳腺癌相关问题时,GPT-4的表现优于GPT-3.5和谷歌双子.
科学领域:
- 人工智能在医学中的应用
- 瘤学 信息学 信息学
背景情况:
- 大型语言模型 (LLM) 在处理复杂的医疗信息方面具有实用性.
- 在乳腺癌护理等专业领域,LLM的应用需要严格的评估.
研究的目的:
- 评估三个著名的LLM (GPT-3.5,GPT-4和Google Gemini) 在回答乳腺癌相关问题的表现.
- 为了比较LLMs在乳腺癌护理的不同领域的准确性.
主要方法:
- 使用一组60个选择题,涵盖乳腺癌治疗,预后,诊断,成像和病理学.
- 问题来源于公共数据库,并由专家乳腺放射科医生新制定.
- 评估了GPT-3.5,GPT-4和谷歌双子座在回答这些问题的准确性.
主要成果:
- 在LLM中观察到正确答案率的统计学上显著差异 (p=0.010).
- GPT-4获得了最高的准确性 (95%),其次是GPT-3.5 (90%),以及谷歌双子座 (80%).
- 从公共数据库和新制定的问题 (p≥0.593) 之间没有发现准确度的显著差异.
结论:
- 通过准确回答临床问题,LLM,特别是GPT-4,具有很强的潜力来支持乳腺癌护理.
- 通过上下文培训进行进一步的改进是必要的,以优化LLM在这个领域的表现.
- 法律法学可以有效地处理问题,无论其来源如何 (公共数据库与专家制定).


