从预训练到微调:对生物医学领域的大型语言模型进行深入分析
Agnese Bonfigli1, Luca Bacco2, Mario Merone3
1Research Unit of Intelligent Technology for Health and Wellbeing, Department of Engineering, Università Campus Bio-Medico di Roma, Via Alvaro del Portillo, 21, Rome, 00128, Italy; ItaliaNLP Lab, Institute of Computational Linguistics "Antonio Zampolli", National Research Council, Via Giuseppe Moruzzi, 1, Pisa, 56124, Italy.
Artificial intelligence in medicine
|October 29, 2024
概括
大型语言模型 (LLM) 在生物医学中表现有前途,但它们的有效性取决于内部机制. 本研究分析了LLM如何适应和处理生物医学数据,以完成NLI和NER等任务.
科学领域:
- 生物医学信息学 生物医学信息学
- 人工智能的人工智能
- 计算语言学 计算语言学
背景情况:
- 基于变压器的大型语言模型 (LLM) 提供了高级功能.
- 生物医学领域呈现出独特的数据复杂性和专业知识要求.
- 了解LLM在这个领域的适应对于有效应用至关重要.
研究的目的:
- 调查生物医学领域预培训的LLM的适应性和有效性.
- 分析下游业绩和LLMs中的信息封装之间的相关性.
- 探索生物医学任务LLM的内部编码和注意力机制.
主要方法:
- 检查了基于编码器和解码器的LLM,包括一般和生物医学特定的模型.
- 在微调之前和之后分析了内部编码和注意力机制.
- 专注于自然语言推断 (NLI) 和命名实体识别 (NER) 任务.
主要成果:
- LLM下游效率与其内部机制中的特定模式密切相关.
- 研究结果揭示了LLM如何在生物医学环境中处理和应用知识.
- 模型的性能与其封装任务相关信息的能力相关.
结论:
- 在生物医学应用中,LLM的内部运作对其成功有很大影响.
- 具体的注意力和编码模式是有效的知识处理的关键.
- 对LLM机制的进一步研究可以优化其在专业领域的使用.


