一项基于大型语言模型的零射击推断和乳腺癌病理学报告的特定任务监督分类的比较研究报告
Madhumita Sushil1, Travis Zack1,2, Divneet Mandair1,2
1Bakar Computational Health Sciences Institute, University of California, San Francisco, San Francisco, CA 94158, United States.
概括
像GPT-4这样的大型语言模型 (LLM) 可以减少临床自然语言处理 (NLP) 研究中的数据注释需求. 这通过尽量减少病理学报告的手动标签工作来加速研究.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 医疗保健中的机器学习
- 临床信息学 临床信息学
背景情况:
- 监督机器学习用于临床笔记信息提取需要大量的,耗时的数据注释.
- 大型语言模型 (LLM) 在转移学习方面表现有前途,可能减少注释负担.
研究的目的:
- 调查最近的LLM是否可以减少临床NLP任务中大规模数据注释的必要性.
- 为了比较LLM与监督模型的零射击分类性能.
主要方法:
- 769份乳腺癌病理学报告的数据集被策划和手动标记为12个类别.
- 对GPT-4,GPT-3.5,Starling和ClinicalCamel的零射击分类能力进行了评估.
- 性能与监督模型进行了比较:随机森林,LSTM-Att和UCSF-BERT.
主要成果:
- 在12个任务中,GPT-4显著超过或匹配最好的监督模型 (LSTM-Att). 宏观的F1得分为0.86与0.75).
- 在高标签不平衡的任务中,GPT-4显示出了优势.
- 其他评估的LLM表现不佳;GPT-4错误涉及复杂的推断和任务设计.
结论:
- 临床NLP中的LLM,特别是GPT-4,可以缓解临床NLP中的数据标签挑战,特别是当很难获得大型注释数据集时.
- GPT-4的性能表明它可以加速临床NLP研究,并增加NLP衍生变量的使用.
- 具有足够注释数据的更简单的监督模型可以产生可比的结果,如果LLM的使用是不可行的.
更多相关视频
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.8K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
