医療教育におけるAI駆動評価のための訓練済み大型言語モデルを使用する
Jacob Cole1, Joshua Duncan2, Rebekah Cole3
1J. Cole is associate professor, Department of Anesthesiology and Department of Military and Emergency Medicine, Uniformed Services University of the Health Sciences, Bethesda, Maryland.
まとめ
大規模な言語モデル (LLM) は,医学生の道徳的傷害の理解を評価する上で有望であり,より客観的で効率的な評価を提供します. このAIによるアプローチは 医療倫理の訓練における フィードバックと教育成果を向上させることができます
科学分野:
- 医学教育
- 医療における人工知能
- 医学 の 倫理
背景:
- 能力に基づくプログラムで医学生の評価は 時間的な制約と客観的なフィードバックの必要性のために困難です.
- 伝統的な評価方法には一貫性や ターゲットを絞ったフィードバックが欠けています 特に道徳的傷害のような複雑な問題ではです
研究 の 目的:
- 学生の道徳的傷害の理解を評価するために,リトリーブル・アグメンテッド・ジェネレーションを備えた大型言語モデル (LLM) の使用を試行する.
- 医学倫理コースにおけるLLMベースの評価の効率,客観性,有効性を評価する.
主な方法:
- LLM (Google Gemini 1.5 Pro,Google Gemini 2.0 Flash,OpenAI ChatGPT-4o) は,道徳的傷害に関する重要な記事から格付けラブリックを生成するために使用されました.
- 生徒の回答165件を3つのLLMが作成したラブリックを使って評価した.
- LLMのスコアの精度は,有効性の証拠を確立するために2人の経験豊富な教育者と比較されました.
主要な成果:
- Google Gemini 1.5 Proは,道徳的傷害に対する微妙な格付けラブリックを成功裏に生成しました.
- OpenAI ChatGPT-4oは,ヒトのレビュー者と比較して,最も高い評価者間の信頼性 (0. 77 と 0. 68) を達成し,レビュー者間の合意 (0. 57) を超えた.
結論:
- LLMは,特に専門的な倫理的なトピックにおいて,医学生の評価の効率と客観性を高めるための有望なツールです.
- 倫理的な説明責任を確保し,AI主導の評価における潜在的なバイアスを軽減するために,教員の監督は不可欠です.


