探索一种方法来提取多位乳腺癌患者在患者叙述领域的关注,使用BERT,并通过使用掩面语言建模的域调整优化其优化
Satoshi Watabe1, Tomomi Watanabe1, Shuntaro Yada2
1Division of Drug Informatics, Keio University Faculty of Pharmacy, Tokyo, Japan.
PloS one
|September 6, 2024
概括
这项研究使用自然语言处理 (NLP) 和BERT模型从乳腺癌采访中提取患者的担忧. 域调整显著改善了与治疗相关问题的提取.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 瘤学患者支持服务
背景情况:
- 在线患者叙述为健康问题提供了丰富的见解.
- 从这些叙述中提取具体问题是具有挑战性的,但有价值的.
- 乳腺癌患者在治疗,身体,心理,财务和社会领域表达了不同的需求.
研究的目的:
- 开发和评估一种自然语言处理 (NLP) 模型,用于从乳腺癌患者采访中提取多个问题.
- 调查域调整在改善特定关注类别的NLP模型性能方面的有效性.
主要方法:
- 利用了508名日本乳腺癌患者的采访记录.
- 用五个关注类别标记数据:治疗,身体,心理,工作/财务和家庭/朋友.
- 微调了预先训练的BERT模型用于多标签分类,并将域名调整与博客文章和采访转录相结合.
- 使用5倍交叉验证和精度指标评估分类器性能.
主要成果:
- 精心调整的多标签分类器在"物理"和"工作/财务"问题上实现了高精度 (>0.80).
- 对于"治疗"问题,初始精度很低 (~0.25),没有域调整.
- 域调整将"处理"问题精度提高到0.40-0.51,这是一个显著的增强.
结论:
- 将域调整与多标签分类相结合,可以更有效地从采访数据中提取多个患者的关注点.
- NLP模型,特别是具有域调整的NLP模型,在瘤学中对了解和解决患者需求充满希望.
- 这种方法可以帮助制定更有针对性的患者支持策略.


