LLM

Tong Min Kim1, Youngrong Lee1, Chansik Kim1,2

  • 1Department of Medical Informatics, College of Medicine, The Catholic University of Korea, Republic of Korea.

概括

这项研究使用8个任务和17个不同的评估者评估了大型语言模型 (LLM),这是从以前的有限评估中显著扩展的. 调查结果突出了任务多样性和评估员多样性的对LLM绩效评估的影响.