迅速なエンジニアリングとフォローアップの質問は,大きな言語モデルにおける脊椎手術の質問の読みやすさを改善します
Sohail Daulat1, Nikhil Dholaria2, Gregory Burnet1
1Department of Neurological Surgery, University of Pittsburgh School of Medicine, Pittsburgh, PA.
World neurosurgery
|September 1, 2025
まとめ
迅速なエンジニアリングとフォローアップの質問は,脊椎手術の患者教育のための大きな言語モデル (LLM) の読みやすさを大幅に改善します. ChatGPT-4oは一般的にChatGPT-5よりも読みやすいコンテンツを生み出しました.
科学分野:
- 医学教育
- 医療における人工知能
- 脊椎 の 手術
背景:
- 脊椎外科の患者教育資料は 推奨値を超えています
- 大型言語モデル (LLM) は,教育コンテンツの生成に有望ですが,読みやすさと適応性に関するさらなる研究が必要です.
- アクセシブルな患者情報の作成におけるLLMのパフォーマンスを評価することは極めて重要です.
研究 の 目的:
- どのLLMモデルとプロンプト戦略が脊髄外科の患者教育の読みやすさを最も高めるかを評価する.
- 理解可能なコンテンツの生成における新しいLLMモデルのパフォーマンスを比較する.
- LLMで作成された教材の改善に最適な方法を特定する.
主な方法:
- チャットGPT-4oとチャットGPT-5は5つの一般的な手順で 45の脊髄外科の質問を提示されました.
- 応答は,ベースライン,フォローアップの明確化,第6級レベルの要求,ルールベースの誘導,直接の読みやすさターゲットを含む5つの誘導段階を通じて生成されました.
- 読みやすさは複数のスコアシステム (SMOG,FRE,FKGL,GFI,CLI) を使用して評価され,統計的に分析されました.
主要な成果:
- ChatGPT-4oは,ほとんどの段階において,ChatGPT-5よりも著しく読みやすい反応を生成した (p<0. 001).
- 第6級レベルの要求段階 (第2段階) で,最も読みやすい回答が得られ,目標の51%以上が達成されました.
- 読みやすさを改善するために,複雑なルールに基づく戦略よりも,フォローアップの明確化と簡素化されたプロンプトがより効果的でした.
結論:
- 迅速なエンジニアリングとフォローアップの質問は,患者のためのLLMで生成された脊椎手術の内容の読みやすさを大幅に改善します.
- ChatGPT-4oは読解性が優れていたが,ChatGPT-5はより信頼性の高い引用を提供した.
- 将来の研究は,客観的なスコアを超えて,実際の臨床環境でこれらの発見を検証する必要があります.
関連する概念動画
Improving Translational Accuracy
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
Improving Translational Accuracy
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...


