:?

Qiyu He1, Zhimin Tan2, Wang Niu2

  • 1Department of Urology and Andrology Laboratory, West China Hospital, Sichuan University, Chengdu, Sichuan Province, China.

概括

大型语言模型 (LLM) 显示出临床推理的潜力,但可能存在关键错误. 尽管DeepSeek-R1和GPT-4都在复杂的场景中扎,但它们的表现优于其他,这凸显了在高风险的医疗环境中需要仔细评估.