数据集和基准 (MedGPTEval) 来评估医学中大型语言模型的响应:评估开发和验证
Jie Xu1, Lu Lu1, Xinwei Peng1
1Shanghai Artificial Intelligence Laboratory, OpenMedLab, Shanghai, China.
JMIR medical informatics
|July 2, 2024
概括
开发了一个新的评估系统MedGPTEval,用于评估医学中的大型语言模型 (LLM). MedGPTEval发现,与其他LLMs相比,Dr PJ模型在医疗对话和病例报告中表现优越.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在临床应用中表现有希望,但有可能产生不可靠的反应 (幻觉).
- 医疗LLM中的幻觉带来了严重的患者安全风险.
- 医疗LLM的系统评估对于识别和减轻这些风险至关重要.
研究的目的:
- 开发和验证一个全面的评估系统,MedGPTEval,用于评估医疗领域的大型语言模型.
- 通过使用开发的系统,对包括ChatGPT,ERNIE Bot和Dr PJ在内的领先LLM的绩效进行基准评估.
主要方法:
- 通过文献审查和专家共识 (德尔菲方法) 设计评估标准.
- 创建了中国医疗数据集,包括对话和病例报告,用于LLM互动.
- 经授权的医学专家使用既定标准对LLM产生的反应进行了盲目评估.
主要成果:
- 开发的MedGPTEval系统包括医疗,社会,上下文和强度能力的16个指标.
- 博士PJ在多轮医疗对话和病例报告场景中表现优于ChatGPT和ERNIE Bot.
- 在语义一致性和错误率方面,PJ博士表现出更好的稳定性,尽管在医学专业能力方面,ChatGPT略高于它.
结论:
- MedGPTEval为评估医学LLM提供了一个强大的框架,包括开源数据集和基准.
- 实验结果表明,与ChatGPT和ERNIE Bot相比,PJ博士在社会和专业医疗环境中的表现优越.
- 研究人员可以轻松采用MedGPTEval系统,以增强开源医学LLM数据集并促进进一步开发.
更多相关视频
03:37Author Spotlight: Impact of Intergenic Interactions on Disease-Identifying Dark Biomarkers
Published on: March 1, 2024
686
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
