中国語の文脈における中絶後のケアに関する問い合わせに対する3つの大きな言語モデルの応答の評価:比較分析
Danyue Xue1,2, Sha Liao1,2
1Department of Operating Room Nursing, West China second University Hospital, Sichuan University, Chengdu, Sichuan, People's Republic of China.
Risk management and healthcare policy
|August 27, 2025
まとめ
3つの大きな言語モデル (LLM) は,中絶後のケアに関する質問に中国語で回答する上で優れたパフォーマンスを示しました. 一般的に正確で関連性があるものの 患者の診察を深めるためには 信頼性の向上が必要である.
科学分野:
- 医療における人工知能
- 医療情報のための自然言語処理
- 生殖医療技術
背景:
- 大型言語モデル (LLM) のような高度なAIツールの能力を評価することは,安全で効果的な医療への統合に不可欠です.
- 妊娠中絶後のケア (PAC) の情報は,生殖保健のサポートを求める個人にとって正確で,アクセスしやすく,信頼できるものである必要があります.
- 医療情報提供におけるLLMの適用は,特にPACのような繊細な分野では,その応答の質を慎重に評価する必要があります.
研究 の 目的:
- 中絶後のケア (PAC) に関する中国語での問い合わせに対する3人の著名なLLM (ChatGPT,Kimi,Ernie Bot) のパフォーマンスを評価する.
- 妊娠中絶後の避妊に関するLLMによる回答の正確性,関連性,完全性,明確性および信頼性を評価する.
- 評価されたLLMの反応の質の潜在的な違いを特定し,PACの協議における将来の適用を参考にする.
主な方法:
- 中絶後の避妊に関する20の異なる質問が中国語でChatGPT,Kimi,Ernie Botにそれぞれ3回提出されました.
- 回答は3人のPACコンサルタントによって,正確さ,関連性,完全性,明確性,信頼性を評価して評価されました.
- 3つのLLMの全体的なパフォーマンスと特定の基準のスコアを比較するために統計分析が行われました.
主要な成果:
- 総計,LLMの回答の88.30%が"良好"と評価され,モデル間の全体的な評価では有意な差異はなかった (P = 0.352).
- 関連性 (85.53%),完全性 (75.57%) および明確性 (73.87%) で高いスコアを得ましたが,正確性 (48.33%) と信頼性 (71.10%) では改善の余地がありました.
- 統計的に有意な差は,LLMの回答の信頼性 (P < 0. 001) で見られ,信頼性の変動を示しています.
結論:
- 評価されたLLMは,正確さ,関連性,完全性において一般的に良好なパフォーマンスを示すため,PACの協議を支援する大きな可能性を示しています.
- LLMで生成されるPAC情報の正確性と信頼性を高めるには,継続的なトレーニングと厳格な評価が必要である.
- 繊細な医療の状況で一貫性のある信頼性の高い情報提供を確保するために,LLMの対応を最適化することに焦点を当てるべきです.


