大型语言模型在命名实体识别中的性能和可重现性:在受控环境中使用的考虑因素
Jürgen Dietrich1, André Hollstein2
1Pharmaceuticals, Medical Affairs and Pharmacovigilance, Data Science and Insights, Bayer AG, Müllerstr. 178, 13353, Berlin, Germany. juergen.dietrich@bayer.com.
Drug safety
|December 11, 2024
概括
大型语言模型 (LLM) 对医疗保健具有前景,但GPT 3.5和GPT 4的可复制性问题阻碍了它们在受监管系统中的使用. 建议使用GPT模型来生成培训数据建议,以提高绩效.
科学领域:
- 医疗保健中的人工智能
- 在医疗应用中使用自然语言处理 (NLP).
背景情况:
- 人工智能 (AI) 最近的进步导致了能够产生类似人类反应的大型语言模型 (LLM) 的开发.
- 在医疗保健中LLM的潜在应用需要对其在受控,受监管环境中的有效性,可重复性和可操作性的严格评估.
研究的目的:
- 评估GPT 3.5和GPT 4适用于集成到GxP验证系统中的适用性.
- 将外部托管的GPT模型与内部托管的LLMs的性能进行比较.
- 探索LLM用于命名实体识别 (NER) 和关系提取的零射击性能,并评估它们在生成培训数据建议方面的潜力.
主要方法:
- 进行了可重复性实验,以确定LLM在受控环境中的可行性.
- 使用引导生成来确保在各种模型中一致提示.
- 短暂的学习和量化低等级适应 (QLoRA) 微调被用来提高LLM的表现.
主要成果:
- 发现零射击GPT 4的性能与微调的T5模型相当.
- 泽菲尔在零射击GPT 3.5上表现出优越的性能,尽管微调的T5在识别产品组合方面表现出色.
- 两种GPT变体都表现出缺乏可重复性,这是受监管环境的关键限制.
结论:
- 像GPT变体一样,封闭的专有LLM的可复制性限制可能会阻碍它们在受监管的医疗保健系统中使用.
- 尽管存在复制性挑战,但GPT模型显示出强大的命名实体识别 (NER) 功能,这使得它们对于生成注释建议以训练其他模型非常有价值.
- 对内部托管的LLM和微调技术进行进一步的研究是有必要的,以便可靠地集成到验证的系统中.


