結膜炎の研究におけるAI:幻覚率分析によるエチオロギー,介入,引用整合性の評価
Muhammad Hasnain1, Khursheed Aurangzeb2, Musaed Alhussein2
1Department of Computer Science, Lahore Leads University, Lahore, Pakistan.
Frontiers in artificial intelligence
|September 5, 2025
まとめ
DeepSeekはChatGPTよりもコンjunctivitisに関するより正確な医学的情報を提供しており,幻覚の発生率は低い. クロードは画像分類の精度で優れ チャットGPTを上回っています
科学分野:
- 医療における人工知能
- 自然言語処理アプリケーション
- 医療診断
背景:
- 大規模な言語モデル (LLM) は医療において有望である.
- LLMの診断能力の評価は極めて重要です
- プロンプトエンジニアリングは LLM のパフォーマンスを向上させます.
研究 の 目的:
- AIモデルの診断精度を比較する (ChatGPT,DeepSeek,Claude).
- 臨床的な質問と画像分析のためのLLMを評価する.
- 応答の質に対するプロンプトエンジニアリングの影響を調査する.
主な方法:
- ChatGPTとDeepSeekを使って 臨床的な質問に答えました
- ChatGPT,Claude,DeepSeekで 結膜炎の画像分析をしていました
- 迅速なエンジニアリングと感度分析を適用した.
主要な成果:
- DeepSeekはより正確な結膜炎情報を提供しました (7%の幻覚とChatGPTの13%).
- クロードはバイナリ画像分類で100%の精度を達成し,ChatGPTの62.5%を上回りました.
- DeepSeekは画像データセットの 分析の限界を示しました
結論:
- DeepSeekはテキストベースの医療クエリに優れているが,ChatGPTは一般的な情報に優れている.
- クロードは画像ベースの診断作業で優れたパフォーマンスを示しています.
- AIモデルは医療診断の可能性を秘めていますが,特定のアプリケーションでは慎重に評価する必要があります.


