推进意大利生物医学信息提取以变压器为基础的模型:方法见解和多中心实践应用.
Claudio Crema1, Tommaso Mario Buonocore2, Silvia Fostinelli3
1Laboratory of Neuroinformatics, IRCCS Istituto Centro San Giovanni di Dio Fatebenefratelli, Brescia, Italy.
Journal of biomedical informatics
|November 28, 2023
概括
这项研究介绍了意大利神经精神病学命名实体识别数据集PsyNIT,以及从临床笔记中提取数据的变压器模型. 这促进了医疗保健中的自动信息提取,特别是在资源不足的语言中.
科学领域:
- 自然语言处理自然语言处理.
- 临床信息学 临床信息学
- 计算语言学 计算语言学
背景情况:
- 计算机化医疗记录减少了手工任务,但其数据仍未得到充分利用.
- 从非结构化的临床文本中提取信息是耗时的.
- 自动化文本挖掘管道可以提高数据可访问性.
研究的目的:
- 开发意大利第一个神经精神病学命名实体识别数据集 (PsyNIT).
- 创建基于变压器的模型,从临床笔记中提取信息.
- 在资源较少的语言中建立NLP的方法指南.
主要方法:
- 创建意大利神经精神病学实体的PsyNIT数据集.
- 基于变压器的命名实体识别模型的开发.
- 使用外部数据集实施多中心模型.
主要成果:
- 开发的多中心模型的F1得分为84.77%,精度为83.16%,回忆率为86.44%.
- 证明了一致的注释和"低资源"微调策略的重要性.
- 成功地将NLP技术应用于非结构化的临床文本.
结论:
- 自动信息提取可以释放临床数据的潜力.
- 一致的注释和自适应微调是NLP模型性能的关键.
- 方法指南有助于在资源有限的语言中进行NLP研究.


