梅迪阿尔贝蒂纳:一个欧洲葡萄牙医疗语言模型
Miguel Nunes1, João Boné2, João C Ferreira3
1ISTAR, Instituto Universitário de Lisboa (ISCTE-IUL), 1649-026, Lisbon, Portugal.
Computers in biology and medicine
|October 3, 2024
概括
这项研究开发了MediAlbertina,这是第一个欧洲葡萄牙医疗语言模型,改进了从电子健康记录中提取信息. 适应域名的模型显著提高了诸如命名实体识别等任务的准确性.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 医疗信息学 医疗信息学
背景情况:
- 医疗保健中的非结构化患者数据经常包含缩写和缩写,妨碍自动解释.
- 基于变压器的语言模型为处理复杂的医学文本提供了潜力.
- 开发特定领域的语言模型对于非英语语言,如欧洲葡萄牙语 (PT-PT),至关重要.
研究的目的:
- 通过调整预先训练的变压器来开发欧洲葡萄牙语 (PT-PT) 医疗保健领域语言模型.
- 改进PT-PT中的非结构化医疗信息的自动解释.
主要方法:
- 在阿尔伯蒂娜PT-PT 900M语言模型的继续预训练中,使用了超过260万个电子医疗记录.
- 应用了称为掩面语言建模的域名适应技术.
- 由此产生的模型被称为MediAlbertina PT-PT 900M.
主要成果:
- 与基线相比,MediAlbertina PT-PT的困惑度显著减少,从大约20降至1.6.
- 精细调整MediAlbertina对命名实体识别和断言状态任务的微调,导致回忆和F1分数有4-6%的改善.
- 适应领域的模型在医疗信息提取任务中表现优于通用基线.
结论:
- 梅迪阿尔贝蒂纳 (MediAlbertina) 是第一个在PT-PT数据上训练的公开可用的医疗语言模型.
- 域调整是提高语言模型性能在专业领域的有效策略.
- 该模型为科学界提供了宝贵的资源,有助于开发临床决策支持系统和PT-PT语言数据的医疗时间表.


