罗布森标准和产科实体的手动注释:注释者之间的协议和初始NER模型的实施
Orlando Ramos-Flores1, Helena Gómez-Adorno1, Mónica Vazquez1
1Instituto de Investigaciones en Matemáticas Aplicadas y en Sistemas, Universidad Nacional Autónoma de Mexico, Coyoacán, C.P. 04510, Mexico City, Mexico.
Computers in biology and medicine
|August 27, 2025
概括
这项研究引入了一个新的数据集来分类罗布森标准, 这对于理解分娩至关重要. 经过命名实体识别模型的训练,RoBERTa和XLM-RoBERTa在提取产科信息方面表现最好.
科学领域:
- 医疗信息学
- 产科和妇科
- 自然语言处理
背景情况:
- 使用罗布森标准对分娩进行准确的分类对于产科护理管理和研究至关重要.
- 手动从电子健康记录 (EHR) 中提取相关信息耗时且容易出现错误.
- 开发信息提取的自动化方法可以提高产科数据分析的效率和一致性.
研究的目的:
- 为罗布森标准分类创建一个手动注释的数据集,包括产科变量,药物和结果.
- 培训和评估各种命名实体识别 (NER) 模型,以从产科电子健康记录中提取信息.
- 比较不同NER模型的性能,包括传统的机器学习和深度学习方法.
主要方法:
- 对于与罗布森标准相关的实体,一个包含1865个电子健康记录 (EHR) 的数据集进行了手动注释.
- 使用F1和Kappa分数进行了对注者间一致的评估,获得了高可靠性 (F1: 0.86- 0.93,Kappa: 0.89- 0.94).
- 一些NER模型 (CRF,BERT,RoBERTa,XLM-RoBERTa,Llama 3.1-8B-Instruct) 在23个标签和46个标签方案上进行了培训和评估.
主要成果:
- 条件随机场 (CRF) 模型获得了最高的精度 (0.69-0.74).
- 在两种标签方案中,RoBERTa和XLM- RoBERTa模型显示出优异的回忆率 (0.70- 0.76) 和F1分数 (0.65- 0.72).
- 深度学习模型,特别是RoBERTa和XLM-RoBERTa,在整体信息提取准确性方面表现优于传统方法.
结论:
- 开发的注释数据集是培训和评估产科NER模型的宝贵资源.
- 像RoBERTa和XLM-RoBERTa这样的先进深度学习模型对于从EHR中自动提取产科信息是有效的.
- 这项工作为罗布森标准分类和产科研究提供了更高效,更准确的数据分析.
更多相关视频
08:40Isokinetic Robotic Device to Improve Test-Retest and Inter-Rater Reliability for Stretch Reflex Measurements in Stroke Patients with Spasticity
Published on: June 12, 2019
7.5K
07:45Author Spotlight: Standardizing Mouse In Vivo PET Imaging with Body Conforming Molds and Automated Analysis
Published on: October 25, 2024
485
