基于标准化问卷的宫癌管理中大型语言模型的性能评估:比较研究
Warisijiang Kuerbanjiang1, Shengzhe Peng1, Yiershatijiang Jiamaliding1
1Department of Gynecology, Zhongnan Hospital of Wuhan University, Wuhan, Hubei Province, China.
Journal of medical Internet research
|February 5, 2025
概括
大型语言模型 (LLM) 在宫癌管理方面显示出潜力,像ChatGPT-4.0 Turbo这样的专有模型表现优于其他模型. 提示提升了准确性,但医疗专业模型需要进一步开发用于临床使用.
科学领域:
- 人工智能在医学中的应用
- 计算健康 计算健康
- 数字健康数字健康
背景情况:
- 宫癌是一个重大的全球健康挑战,特别是在资源较低的环境中.
- 综合管理需要综合查,诊断和治疗策略.
- 大型语言模型 (LLM) 具有潜力,但在宫癌治疗中尚未得到充分探索.
研究的目的:
- 系统地评估LLMs在宫癌管理中的性能和可解释性.
- 根据准确性和准则合规性,比较不同LLM的有效性.
- 评估提示在医学背景下对LLM绩效的影响.
主要方法:
- 从AlpacaEval排名表 v2.0.0 中选择的LLM
- 开发了100个标准化问题,涵盖宫癌查,诊断和治疗.
- 使用CO-STAR框架进行快速工程.
- 对准确性,遵循指导方针,清晰性和实用性 (A-D评分) 的评价.
- 使用LIME进行解释性分析.
主要成果:
- 在9个评估的LLMs中,ChatGPT-4.0 Turbo排名最高 (有效率为94%).
- 七个模型表现出稳定的反应; QiZhenGPT 持续表现不佳.
- 提示对专有模型的人类注释进行了改进.
- 医疗专业模型显示,随着提示的使用,改善程度有限.
结论:
- 专有LLM (ChatGPT-4.0 Turbo,Claude 2) 在宫癌的临床决策支持方面表现有前途.
- 快速工程可以提高LLM在这个领域的准确性.
- 需要进一步的研究来将LLM整合到实际的医疗应用中.
更多相关视频
06:46Competing-Risk Nomogram for Predicting Cancer-Specific Survival in Multiple Primary Colorectal Cancer Patients after Surgery
Published on: September 27, 2024
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
