评估大型语言模型作为医学短答题的评分器:与专家人类评分器进行比较分析

Olena Bolgova1, Paul Ganguly1, Muhammad Faisal Ikram1

  • 1College of Medicine, Alfaisal University, Riyadh, Kingdom of Saudi Arabia.

Medical education online
|August 24, 2025
PubMed
概括

大型语言模型 (LLM) 显示出对医学短答题的评分有希望,但性能因模型和医学学科而异. 专家标准并没有持续提高LLM的准确性,因此需要特定领域的实施和人类监督.