提高生物医学数据GPT-3/4结果的准确性,使用检索增强语言模型
David Soong1, Sriram Sridhar1, Han Si1
1Translational Data Sciences, Genmab, Princeton, New Jersey, United States of America.
PLOS digital health
|August 21, 2024
概括
检索增强生成 (RAG) 模型在生物医学研究中表现有前途,因为它比一般大语言模型 (LLM) 更准确和相关. 一个定制的RAG模型在回答扩散大B细胞淋巴瘤问题的问题上表现优于GPT-4和GPT-3.5.
科学领域:
- 人工智能的人工智能
- 生物医学研究生物医学研究
- 自然语言处理自然语言处理.
背景情况:
- 一般用途的大型语言模型 (LLM) 具有广泛的知识,但在专业领域可能会产生不准确性.
- 特定领域的LLM提高了准确性,但需要大量的培训资源.
- 提取增强生成 (RAG) 提供了一个潜在的解决方案,可以在没有密集的再培训的情况下改善特定领域的LLM绩效.
研究的目的:
- 与一般用途的LLM相比,以检索增强生成 (RAG) 模型的性能进行评估,以回答特定生物医学研究领域的问题.
- 评估不同LLM和自定义RAG模型生成的响应的准确性,相关性和可读性.
主要方法:
- 使用定制的RAG模型和现有的LLM (OpenAI的GPT-3.5,GPT-4,微软的普罗米修斯) 回答了关于扩散性大B细胞淋巴瘤 (DLBCL) 生物学和治疗的19个问题.
- 八名独立审稿人使用3分级来评估LLM的准确性,相关性和可读性.
- 分析了性能指标,以比较模型.
主要成果:
- 与一般用途的LLMs相比,RAG模型在准确性和相关性方面获得了更高的平均分数.
- 虽然GPT-4与RAG模型具有相似的相关性,但其准确性较低.
- GPT-4和GPT-3.5的可读性得分较高,但幻觉的情况也较多 (例如,伪造的参考,不准确的临床信息).
结论:
- 一个以瘤学研究为重点的RAG模型可以在准确性和相关性方面优于一般目的LLM对特定主题的查询.
- 该RAG框架可适应各种专业领域的问答.
- 需要进一步的研究来探索不同LLM架构,RAG方法和提示策略的影响.


