数据集和基准 (MedGPTEval) 来评估医学中大型语言模型的响应:评估开发和验证

Jie Xu1, Lu Lu1, Xinwei Peng1

  • 1Shanghai Artificial Intelligence Laboratory, OpenMedLab, Shanghai, China.

PubMed
概括

开发了一个新的评估系统MedGPTEval,用于评估医学中的大型语言模型 (LLM). MedGPTEval发现,与其他LLMs相比,Dr PJ模型在医疗对话和病例报告中表现优越.

相关概念视频