一个大型语言模型的开发和性能,用于对多语言医学成像指南和共识的质量评估
Zhixiang Wang1,2, Jing Sun3, Hui Liu4
1Department of Ultrasound, Beijing Friendship Hospital, Capital Medical University, Beijing, China.
Journal of evidence-based medicine
|April 4, 2025
概括
这项研究开发了一种使用大型语言模型 (LLM) 的自动化系统,以有效评估医学成像指南. 人工智能工具显著减少了评估时间和成本,提高了跨语言的一致性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床指南开发 临床指南开发
背景情况:
- 评估医学成像指南和共识 (GACS) 的质量至关重要,但劳动密集型.
- 现有的GACS评估手动方法耗时,昂贵,容易出现不一致,特别是在多种语言之间.
研究的目的:
- 开发和评估基于大型语言模型 (LLM) 的自动化系统,用于评估GACS质量.
- 提高GACS评估的效率,一致性和多语言能力.
- 为了减少与传统指南评估相关的手工工作量.
主要方法:
- 开发了QPC-HASE-GuidelineEval算法,整合了四象限问题分类策略和混合搜索增强.
- 从2021-2022年对45个医学成像指南 (36个中文,9个英语) 验证了算法.
- 使用专家评估的一致性,段落匹配准确性,信息完整性和成本-时间效率来评估绩效.
主要成果:
- 该算法平均准确率为77%,在更简单的任务中性能更高.
- 混合搜索在段落匹配和信息完整性方面显著超过了基于关键字和稀疏密度的检索方法.
- 评估时间减少到每条指南大约8.5分钟,每条指南的成本约为0.5美元.
结论:
- 基于LLM的QPC-HASE-GuidelineEval算法显示了提高GACS评估效率,可扩展性和多语言支持的巨大潜力.
- 为了处理复杂的评估任务,需要对视觉辅助工具进行更深入的解释和分析,需要进一步改进.
更多相关视频
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.3K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
