医学的な短い答えの質問の格付け者としての大規模な言語モデルの評価:専門家の人間の格付け者との比較分析

Olena Bolgova1, Paul Ganguly1, Muhammad Faisal Ikram1

  • 1College of Medicine, Alfaisal University, Riyadh, Kingdom of Saudi Arabia.

Medical education online
|August 24, 2025
PubMed
まとめ

大型言語モデル (LLM) は医学的な短答えの質問の格付けに有望ですが,性能はモデルと医学分野によって異なります. 専門家の基準は一貫してLLMの精度を向上させず,ドメイン特有の実装と人間の監督を必要とした.