利用大型语言模型来检测药物不良事件:对基于令牌和跨度的命名实体识别进行比较研究
Howard Prioleau1, Saurav K Aryal2, Jeremy Blackstone2
1EECS, Artificial Intelligence for Positive Change (AI4PC) Lab, Howard University, Washington, DC 20059, USA, howard.prioleau@bison.howard.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
概括
大型语言模型 (LLM) 显示出在临床文本中检测不良药物事件 (ADEs) 的前景. 微调的RoBERTa 大型模型和组合方法显著改善了ADE检测和关系提取,以确保患者的安全.
科学领域:
- 自然语言处理自然语言处理.
- 医疗保健中的人工智能
- 临床信息学 临床信息学
背景情况:
- 药物不良事件 (ADEs) 是对患者安全和公共健康的重大关注.
- 目前在临床文本中检测ADEs的方法因复杂性和上下文模糊性而面临挑战.
研究的目的:
- 调查微调的大型语言模型 (LLM) 在临床文本中检测ADEs的有效性.
- 为了比较代币分类和基于跨度的命名实体识别 (NER) 方法用于ADE识别.
- 评估集合方法对改善端到端ADE关系提取的影响.
主要方法:
- 使用2018 n2c2 Track 2数据集来评估模型性能.
- 微调的RoBERTa 大型模型用于令牌分类和基于跨度的NER任务.
- 在预定义 (黄金标签) 和端到端设置中评估模型.
- 实施集体方法,包括多数投票和基于XGBoost的聚合.
主要成果:
- 罗伯塔Large在ADE检测方面表现出卓越的性能,优于其他型号.
- 基于令牌的模型通常比基于跨度的方法获得更高的准确性.
- 集合方法通过结合单个模型的优势,显著增强了端到端的关系提取.
- 由于内在的上下文模糊性,ADE的识别仍然具有挑战性.
结论:
- 精心调整的LLM,特别是RoBERTa Large,为改善临床文本中的ADE检测提供了一个强大的工具.
- 整体策略可以进一步提高LLMs在临床NLP任务中的表现.
- 这些进步有可能增强临床NLP管道,并为更安全,个性化的医疗保健做出贡献.

