大型语言模型的性能评估与检索增强生成在日本心脏病专家检查中的性能评估
Hiromasa Hayama1,2, Tu Hao Tran3, Jin Kirigaya1,2
1School of Clinical Medicine, University of New South Wales Sydney, NSW Australia.
Circulation reports
|August 11, 2025
概括
检索增强型大语言模型 (RAG-LLMs) 显示出对心脏病学检查的希望. 与通用LLM相比,CardioCanon表现出卓越的基于案例的准确性,增强了AI辅助的医学教育.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 心脏病学培训心脏病学培训
背景情况:
- 大型语言模型 (LLM) 显示了医学教育的潜力.
- 对心脏病专家检查的LLM的应用尚未得到充分研究.
- 本研究将专业的RAG-LLM (CardioCanon) 与通用LLM进行比较.
研究的目的:
- 为了评估一个名为CardioCanon的提取增强代LLM (RAG-LLM) 的性能.
- 为了比较CardioCanon的准确性与一般用途的LLM对心脏病专家检查问题的准确性.
- 评估RAG技术对人工智能辅助考试绩效的影响.
主要方法:
- 利用来自日本心脏病专家考试 (1997-2022) 的96个公开的,基于文本的,开源的多选题.
- 对比了CardioCanon与ChatGPT-4o和双子座2.0闪存的性能.
- 评估了选项级和基于案例的准确性.
主要成果:
- 卡迪奥卡农实现了与ChatGPT-4o (81.0%与76.0%) 和Gemini 2.0 Flash (81.0%与77.2%) 相似的选项级准确性.
- 卡迪奥卡农表现出明显更高的基于病例的准确性比ChatGPT-4o (57.3%对比29.2%,P<0.001).
结论:
- 检索增强生成 (RAG) 技术可以提高人工智能辅助检查的性能.
- 在医疗教育的AI模型中,RAG改善了案例级推理和决策.
- 卡迪奥卡农显示了改善心脏病专家培训和评估的潜力.
更多相关视频
相关概念视频
Improving Translational Accuracy
2.7K
2.7K
Myasthenia Gravis: Diagnostic Tests
1.3K
Myasthenia gravis is an autoimmune condition affecting neuromuscular transmission, causing generalized weakness in skeletal muscles. Initial diagnoses rely on patients' signs, symptoms, and medical history. The challenge lies in distinguishing myasthenia from other muscular dystrophies. An important diagnostic feature is the significant improvement of symptoms after administering anticholinesterase inhibitors.
The edrophonium test is a diagnostic tool for myasthenia gravis. It involves...
The edrophonium test is a diagnostic tool for myasthenia gravis. It involves...
1.3K


