皮膚科におけるGPT-4学習モデルの実装:医療品質と有用性の評価
Aryan Naik1, Peter Vien1, Thanh-Nga Tran2
1Larner College of Medicine, The University of Vermont, Burlington, Vermont, USA.
まとめ
GPT-4のような大型言語モデル (LLM) は皮膚科学において潜在的可能性を示しているが,検証が必要である. 一般的に安全であるにもかかわらず,GPT-4の出力は,医療品質評価において低得点となり,さらなる最適化の必要性を示した.
科学分野:
- 医療における人工知能
- 皮膚科 AI アプリケーション
背景:
- GPT-4のような大型言語モデル (LLM) は,臨床情報を生成することができます.
- GPT-4皮膚科の医療品質と精度を評価することは欠けている.
研究 の 目的:
- 皮膚科学におけるGPT-4モデルの医療品質と治療推奨の正確さを評価する.
- GPT-4のアウトプット (ChatGPT-4,Copilot) とUpToDate (UTD) を,33の皮膚疾患で比較する.
主な方法:
- GPT-4モデルは,33の疾患の要約と治療法を生成しました.
- DISCERNスコアは医療の質を評価し,UTDの治療法との一致性は皮膚科医によって評価されました.
- 統計的分析には,ペア化されたtテストとANOVAが含まれていました.
主要な成果:
- UTDのコンテンツ品質は"公正"と評価され,ChatGPT-4とCopilotはDISCERNによって"貧弱"と評価されました.
- ChatGPT-4の治療勧告は,Copilotと比較して,UTDとのコンコンダンス (33.5%) が著しく高かった.
- GPT-4モデルでは有害な勧告はほとんど出なかった.
結論:
- GPT-4モデルは,皮膚科学のツールとして有望ですが,検証が必要です.
- LLMのパラメータとクエリ構造は,皮膚科に最適化することができます.
- 皮膚科医の判断で使用される将来のLLMは,患者のケアを改善し,時間を節約することができます.

