?

Qiyu He1, Zhimin Tan2, Wang Niu2

  • 1Department of Urology and Andrology Laboratory, West China Hospital, Sichuan University, Chengdu, Sichuan Province, China.

まとめ

大型言語モデル (LLM) は,臨床推論において潜在的可能性を示していますが,重大なエラーのリスクがあります. DeepSeek-R1とGPT-4の性能は他を上回りましたが,どれも複雑なシナリオで苦労し,リスクの高い医療環境で慎重に評価する必要性を強調しています.