一个广泛的基准研究生物医学文本生成和采矿与ChatGPT
Qijie Chen1, Haotong Sun1, Haoyang Liu2,3
1AIDD, Mindrank AI Ltd, Zhejiang 310000, China.
Bioinformatics (Oxford, England)
|September 8, 2023
概括
像ChatGPT这样的大型语言模型在生物医学文本分析中表现有希望,但尚未与最先进的性能相匹配. 需要进一步的研究来提高他们在专业领域的能力.
科学领域:
- 生物医学自然语言处理
- 人工智能在医学中的应用
背景情况:
- 最近自然语言处理 (NLP) 和深度学习的进展显著改善了大型语言模型 (LLM).
- 基于GPT-3.5和GPT-4构建的ChatGPT显示出强大的通用语言理解和推理能力.
- 对ChatGPT在专业领域,特别是生物医学领域的能力的探索是一个越来越感兴趣的领域.
研究的目的:
- 为了全面比较ChatGPT在各种生物医学文本相关任务上的表现.
- 评估其在理解,推理和生成生物医学文本方面的有效性.
- 为了确定ChatGPT的局限性,特别是基于GPT-3.5的版本,在这个领域.
主要方法:
- 使用了BLURB基准数据集,包括生物医学摘要和临床试验描述.
- 在标准NLP任务上评估ChatGPT,例如命名实体识别,关系提取,句子相似性,问题解答和文档分类.
- 实验中使用的提示在文章中详细说明.
主要成果:
- 聊天GPT获得了BLURB得分58.50,而最先进的模型得分为84.30.
- 在多个生物医学NLP任务中展示了ChatGPT的多功能性.
- 突出了ChatGPT (GPT-3.5) 在复杂的生物医学文本处理中的特定局限性.
结论:
- 在生物医学文本理解,推理和生成方面,ChatGPT表现出了显著的有效性和多功能性.
- 目前的表现表明,与最先进的模型相比,ChatGPT,特别是GPT-3.5,在专门的生物医学应用中存在局限性.
- 需要进一步开发,以增强LLM对高级生物医学NLP任务的能力.


