医学CPT:对比性预训练有素的变压器,具有大规模的PubMed搜索日志,用于零射击的生物医学信息检索
Qiao Jin1, Won Kim1, Qingyu Chen1
1National Center for Biotechnology Information (NCBI), National Library of Medicine (NLM), National Institutes of Health (NIH), Bethesda, MD, United States.
Bioinformatics (Oxford, England)
|November 6, 2023
概括
MedCPT是一款新的对比预训练型变压器,可以在不需要查询文章注释的情况下提升生物医学信息检索 (IR). 这个模型在零射击语义IR任务中实现了最先进的性能.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 信息检索 信息检索
背景情况:
- 获得生物医学知识和临床决策支持在很大程度上依赖于有效的信息检索 (IR).
- 目前使用语言模型编码器的语义检索方法需要广泛的查询文章注释,这在生物医学领域很少.
- 因此,大多数现有的生物医学IR系统都依赖于不那么有效的词汇匹配.
研究的目的:
- 介绍MedCPT,一个开创性的对比预训练型变压器模型,旨在在生物医学中实现零射击的语义信息检索.
- 为了应对有限的注释数据的挑战,用于培训生物医学领域的先进IR模型.
主要方法:
- 从PubMed.收集了2.55亿用户点击日志的大规模数据集.
- 采用对比学习来训练一个集成的回收者和重新排名模型 (MedCPT).
- 在六个生物医学IR任务中评估了MedCPT.
主要成果:
- 在六个生物医学IR任务中,MedCPT实现了新的最先进的性能.
- 超过了几个基线模型,包括更大的模型,如GPT-3大小的cpt-text-XL.
- 证明了用于语义评估的生物医学文章和句子表示的优越生成.
结论:
- 在生物医学中,MedCPT为零射击语义信息检索提供了一个强大的解决方案.
- 该模型的有效性和产生强大表示的能力使其适用于各种现实世界生物医学IR应用.
- MedCPT代码和模型是公开的,这有助于进一步的研究和应用.


