通过心脏团队模拟改善大动脉狭窄治疗的大型语言模型的准确性:即时设计分析
Dorian Garin1, Stéphane Cook1, Charlie Ferry1
1Department of Cardiology, University and Hospital Fribourg, Chem. des Pensionnats 2/6, 1752 Villars-sur-Glâne, Switzerland.
European heart journal. Digital health
|July 24, 2025
概括
快速工程在心脏病学决策中显著影响大语言模型 (LLM) 的准确性. 思想树提示,特别是指导思维,在严重的大动脉狭窄症治疗建议中实现了最高的准确性.
科学领域:
- 心脏病学 心脏病学
- 人工智能的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 大型语言模型 (LLM) 在临床决策支持方面表现有前途.
- 快速设计对复杂心脏病学LLM绩效的影响尚不清楚.
研究的目的:
- 评估各种快速设计策略对严重大动脉狭窄 (AS) 治疗建议的LLM性能的影响.
- 将LLM指导治疗决策的准确性和侵入性与专家心脏团队评估进行比较.
主要方法:
- 由心脏团队评估的231名严重AS患者的回顾性审查.
- 使用GPT4-o测试零射击,思维链 (CoT) 和思维树 (ToT) 提示,结合少数射击学习,自由/指导思维和自我一致性.
- 分析初级终点 (平均准确度) 和二级终点 (灵敏度,特异性,AUC,治疗侵入性).
主要成果:
- 引导思维的ToT获得了最高的准确性 (94.04%),显著超过其他方法 (例如,几次射击的ToT达到87.16%,几次射击的CoT达到85.32%).
- 零射击提示产生了最低的准确性 (73.39%).
- 引导思维-ToT显示了最高的AUC (高达0.97),建议与心脏团队的侵入性决定保持一致.
结论:
- 快速设计对严重的AS临床决策中的LLM绩效产生了重大影响.
- 思想树提示,特别是指导思维,大大提高了准确性,并使LLM建议与专家临床判断保持一致.
- LLM可能会倾向于采取更保守的治疗建议.


