大型语言模型在医疗咨询中的性能评估:比较研究
Sujeong Seo1,2, Kyuli Kim1, Heyoung Yang1
1Future Technology Analysis Center, Korea Institute of Science and Technology Information, Seoul, Republic of Korea.
JMIR medical informatics
|January 7, 2025
概括
生成型人工智能 (AI) 在心理健康方面表现有前途. 像GPT-3.5和Llama2这样的最新大型语言模型 (LLM) 擅长回答与抑郁症有关的查询,在医疗咨询中推进AI.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 计算语言学 计算语言学
背景情况:
- 生成型人工智能 (AI) 正在成为交互式顾问.
- 它在医学讨论中的应用,特别是在抑郁症方面,是非常有趣的.
研究的目的:
- 评估人工智能中大型语言模型 (LLM) 的能力,以生成对与抑郁症相关的查询的响应.
- 评估生物医学领域不同LLM的表现.
主要方法:
- 使用PubMedQA和QuoraQA数据集进行多个LLM (BioGPT,PMC-LLaMA,GPT-3.5,Llama2) 的比较.
- 测量生成和原始答案之间的响应相似性.
主要成果:
- 一般LLM,特别是GPT-3.5和Llama2,表现出卓越的性能.
- 这些模型在生成PubMedQA数据集中的医疗询问准确答案方面表现出色.
结论:
- 升级的一般LLM可能会优于生成生物医学知识文本的专业模型.
- 这些发现支持基于人工智能的医疗咨询系统的进步.


