放射線腫瘍学試験問題における人工知能パフォーマンスの評価:ChatGPT対DeepSeek
Ronald Chow1,2,3, Ajay Zheng1, Chenxi Gao1
1Department of Radiation Oncology, New York Proton Center, New York, New York.
Advances in radiation oncology
|December 17, 2025
まとめ
新しい大規模言語モデルであるDeepSeek-R1は、医療質問においてChatGPTよりも精度が低く、応答時間が遅いことを示しています。コスト効率は高いものの、臨床使用前に医療精度を慎重に評価する必要があります。
科学分野:
- 医療における人工知能
- 自然言語処理
- 医療教育テクノロジー
背景:
- 大規模言語モデル(LLM)は、医療質問応答能力についてますます評価されている。
- 新しくリリースされたDeepSeek LLMの医療分野におけるパフォーマンスは未評価のままである。
- 本研究は、医療に関する問い合わせに対するDeepSeekの精度を初めて評価するものである。
研究 の 目的:
- DeepSeek-R1大規模言語モデルの医療精度を評価する。
- 放射線腫瘍学の試験問題におけるDeepSeek-R1のパフォーマンスをChatGPTと比較する。
- 両LLMの応答時間、トークン使用量、コスト効率を評価する。
主な方法:
- DeepSeek-R1とChatGPTをテストするために、600件の放射線腫瘍学の多肢選択問題を使用した。
- 各モデルの精度、プロンプト/完了トークン、実行時間を記録した。
- 質問カテゴリ全体でパフォーマンスを分析し、I型エラー率は0.05とした。
主要な成果:
- DeepSeek-R1は精度84.0%(質問あたり59秒)で、ランドマーク研究では精度が低下(74.2%)。
- ChatGPT o1は精度89.0%(質問あたり10秒)で、ランドマーク研究では高い精度(93.5%)。
- DeepSeek-R1はトークンあたりのコストが高かったが、全体としては大幅に安価だった(2025年2月価格で1.56ドル対37.96ドル)。
結論:
- DeepSeek-R1はChatGPT o1よりも精度が低く、速度も遅いが、コスト効率は大幅に高い。
- モデル間の選択は、精度と効率の目標と財政的考慮事項のバランスをとる必要がある。
- これらのLLMを医療コンテキストで最適に実装するためのさらなる分析が必要である。
さらに関連する動画
07:57Positron Emission Tomography-based Dose Painting Radiation Therapy in a Glioblastoma Rat Model using the Small Animal Radiation Research Platform
Published on: March 24, 2022
3.1K
08:05Detection and Isolation of Cancer in Prostate Biopsies Using Stimulated Raman Histology and Artificial Intelligence
Published on: June 10, 2025
1.1K
