多面性自然语言处理 基于任务评估的双向编码器表示从变压器模型的双语 (韩语和英语) 临床说明:算法开发和验证
Kyungmo Kim1, Seongkeun Park2, Jeongwon Min1
1Interdisciplinary Program for Bioengineering, Seoul National University, Seoul, Republic of Korea.
JMIR medical informatics
|October 30, 2024
概括
这项研究比较了来自变压器的双向编码器表示 (BERT) 模型的韩语和英语临床笔记. 多语种BERT (M-BERT) 在阅读理解和知识推断任务中表现优异.
科学领域:
- 自然语言处理自然语言处理.
- 临床信息学 临床信息学
- 人工智能的人工智能
背景情况:
- 变压器双向编码器表示 (BERT) 模型越来越多地用于临床应用,如患者分类.
- 目前的研究往往忽视了对非英语医学文件中的BERT模型的彻底临床上下文理解评估和比较研究.
- 英语培训的BERT模型在非英语临床环境中的适用性仍未得到证实.
研究的目的:
- 评估各种BERT模型的上下文理解能力,应用于混合韩语和英语临床笔记.
- 确定非英语临床笔记最有效的BERT模型.
主要方法:
- 预先训练的BERT基础,生物BERT (生物医学文本挖掘的BERT),KoBERT (韩国BERT) 和多语言BERT (M-BERT) 使用来自164,460名患者的数据.
- 对比了7个微调任务中的模型性能,以评估上下文理解.
主要成果:
- 在分类任务中,BERT-base和BioBERT表现出色 (最高F1得分为89.32),即使使用有限的韩国代币,也表现出有效性.
- 多语言BERT (M-BERT) 在阅读理解 (F1分数93.77) 和知识推断 (hit@10分数95.41) 中表现出色.
- 模型性能因任务和代币使用而异,少一些未知代币通常会产生更好的结果.
结论:
- 不同的BERT模型在多语言临床领域显示出有效性.
- 结果为在临床和基于语言的应用中选择合适的BERT模型提供了参考.
- 进一步的研究可以探索针对特定非英语临床任务的最佳BERT模型选择.


