相关实验视频
土耳其MedNLI:土耳其医学自然语言推理数据集通过基于大型语言模型的翻译
İskender Ülgen Oğul1, Fatih Soygazi2, Belgin Ergenç Bostanoğlu1
1Computer Engineering, Izmir Institute of Technology, İzmir, Turkey.
PeerJ. Computer science
|March 10, 2025
概括
这项研究开发了一个管道,将医学自然语言推理 (NLI) 数据集翻译成土耳其语,这是一个资源较低的语言. 该方法有效地适应了特定领域的数据,在土耳其生物医学NLP任务中实现了高精度.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 生物医学信息学 生物医学信息学
- 计算语言学 计算语言学
背景情况:
- 自然语言推断 (NLI) 数据集对于NLP至关重要,但对于资源较少的语言来说很少.
- 对于医学等专业领域的手动注释是昂贵和复杂的.
- 医学数据集的直接翻译面临着缩写,单位和文化背景的挑战.
研究的目的:
- 通过翻译现有的英语资源来创建土耳其医疗NLI数据集.
- 为应对特定领域的翻译方面的挑战,包括缩写分辨率和指标转换.
- 评估大型语言模型在适应低资源语言的专业NLP数据集方面的有效性.
主要方法:
- 在医学缩写数据集 (MeDAL) 上微调了Llama-3.1模型,以提取缩写.
- 通过解决缩写和纠正米数单位来精炼NLI对.
- 使用没有语言落后 (NLLB) 模型翻译处理的句子.
- 通过机器学习模型 (BERTurk,BioBERTurk) 和医学专家的审查来评估翻译质量.
主要成果:
- 在TurkMedNLI测试组中,BERTurk获得了75.17%的准确性.
- 对于其测试数据,BioBERTurk 显示了可比性能,准确度为 75.59%.
- 医学专家证实了翻译数据集的质量和可用性.
- 管道成功地适应了一个域特定的NLI数据集,用于一个低资源语言.
结论:
- 大型语言模型是创建低资源语言专用NLP数据集的有效工具.
- 开发的管道为多语言生物医学NLP研究提供了可行的解决方案.
- 这项工作为跨语言医学NLP的未来进展奠定了基础.
关键词:
贝尔特 (BERT) 公司法学士 (LLM) 是一个专业.语言翻译 语言翻译拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉玛拉在MedNLI中.在NLLB中,它是NLLB.自然语言推论自然语言推论自然语言处理自然语言处理.