沿:,

Research square
|February 27, 2026
PubMed
概括

大型语言模型显示出改善的临床推理和多式联络式问答能力,但在具体任务上却很难. 当前的基准标准可能会高估能力,需要对安全的临床部署进行仔细的人在循环评估.