一个统计框架,用于评估大型语言模型的可重复性和可重复性
Cathy Shyr1,2,3, Boyu Ren4, Chih-Yuan Hsu2
1Department of Biomedical Informatics, Vanderbilt University Medical Center, 2525 West End Avenue, Nashville, 37203, TN, USA.
我们开发了一个统计框架来衡量大语言模型 (LLM) 在医学中的可靠性. 我们的研究结果表明,LLM一致性不能保证诊断准确性,强调了医疗AI中需要标准化的可靠性指标的需要.
科学领域:
- 人工智能在医学中的应用
- 计算语言学 计算语言学
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在医学中具有潜力,但由于随机文本生成,它们的可靠性是一个主要问题.
- 士学位成果的变化可能会影响医疗应用,但缺乏评估这一点的标准化指标.
研究的目的:
- 提出和验证一个统计框架,用于系统量化医学应用中LLM的可靠性.
- 引入可重复性和可重复性的指标,评估LLM响应的语义一致性和内部稳定性.
主要方法:
- 开发了一个测量LLM重复性 (相同条件) 和可重复性 (不同的条件) 的框架.
- 评估了LLM响应的语义一致性和内部稳定性.
- 将框架应用于医学推理任务,使用美国医学执照考试 (USMLE) 问题和未诊断疾病网络 (UDN) 案例.
主要成果:
- 与标准化USMLE问题相比,LLM答案对复杂的UDN罕见疾病病例的变化较小.
- 可重复性和可重复性指标与诊断准确性没有相关性.
- 该研究强调,一致的LLM输出并不等同于准确的输出.
结论:
- 拟议的框架提供了一个系统的方法来量化医学LLM可靠性.
- 这种量化对于LLMs在临床实践和生物医学研究中安全有效地整合至关重要.
- 确保LLM可靠性对于推进人工智能驱动的医疗保健解决方案至关重要.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
相关概念视频
Improving Translational Accuracy
Improving Translational Accuracy
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Reliability and Validity
Random and Systematic Errors
Language and Cognition
