大型言語モデル (LLM) の診断と治療の正確性の評価:臨床実験
Igor Amador Barbosa1, Mauro Sergio Almeida Alves1, Paloma Rayse Zagalo de Almeida1
1Dental Clinic Post-Graduate Program, University Center of State of Pará, Belém, Pará, Brazil.
Journal of dentistry
|September 6, 2025
まとめ
歯科インプラントAIチャットボットの 診断の正確性と一貫性において GPT-4oがリードしました コピロットのような他のモデルでは信頼性が低いことが示され,インプラント周病の診断に注意深くAIツールを採用する必要性が強調されました.
科学分野:
- 歯科における人工知能
- 臨床的意思決定支援システム
- ペリインプラント病の診断
背景:
- 人工知能のチャットボットは 臨床的な応用のためにますます探索されています
- 歯科インプラントの 専門分野における AIのパフォーマンスの評価は 極めて重要です
- 植え付近の疾患は,正確で一貫した診断支援を必要とします.
研究 の 目的:
- 歯科インプラントのシナリオをシミュレートした 8 つのAI チャットボットの診断の正確さ,一貫性,および一貫性を評価する.
- 植え付近粘膜炎と植え付近粘膜炎の診断における異なるAIモデルのパフォーマンスを比較する.
- インプラント歯科における臨床的意思決定のためのAIツールの信頼性に関する洞察を提供すること.
主な方法:
- 植え付近疾患の6つの架空の臨床症例を用いた ダブルブラインド実験です
- 8人のAIチャットボットに 3つの独立ランで標準化された質問が寄せられました
- 答えは盲目の調査員によって 金の基準に照らされ 統計分析により チ二乗,フィッシャー精度,コーエン・カッパテストが使われました
主要な成果:
- GPT-4oは,最も高い診断精度 (88. 8%) とモデル内安定性 (κ = 0. 82) を達成した.
- ゲミニは,参照引用に100%適合を示したが,GPT-4oは全体的に他のものを上回った.
- コピロットとディープシークは最も低い信頼性と最も高い反応の変動を示した.
結論:
- GPT-4oは,ペリーインプラント疾患のシナリオにおける診断の正確性と応答の一貫性において優れたパフォーマンスを示しています.
- AIのチャットボット・アーキテクチャとトレーニングは 臨床的推論能力に大きな影響を与えます
- 臨床実務における信頼性の違いを考慮して,注意深く,証拠に基づいたAIツールの採用が推奨されます.


