所有闪亮的都不是黄金:在使用大型语言模型评估,解释和审查研究时保持科学严谨性
Nicole E Dundas1, Tyler Law2, Teva Brender3
1Nicole E. Dundas, M.T.M.: Department of Bioengineering, University of California, Berkeley, Berkeley, California.
本指南为使用大型语言模型 (LLM) 的医疗保健专业人员提供了一个工具箱. 它强调了涉及LLMs的严格科学研究的透明度,可复制性和伦理考虑.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 计算语言学 计算语言学
背景情况:
- 大型语言模型 (LLM) 在医疗保健中迅速被采用,提供了创新机会.
- 这种采用引发了关于科学严谨性,透明度和伦理影响的严重担忧.
- 现有的研究方法可能无法充分解决LLM带来的独特挑战.
研究的目的:
- 为从事LLM研究的临床医生,研究人员和审稿人提供全面的工具箱.
- 突出LLM研究中的基本方法透明度,可复制性和伦理考虑.
- 为导航LLM在医疗保健中的功能,应用和评估的复杂性提供指导.
主要方法:
- 审查LLM运作的基本方面,包括培训数据,偏见和"黑子"的性质.
- 检查提示工程策略,以优化模型交互和系统评估.
- 讨论解释LLM成果的挑战,倡导可解释性和公平性.
主要成果:
- 在LLM解释性,偏见缓解和道德部署方面确定了关键挑战.
- 强调需要明确报告计算资源和环境影响.
- 强调了快速模型代导致研究过时的风险.
结论:
- 传统的同行评审实践往往被LLM进化所超越,需要新的指导方针.
- 需要严格的定性评估,以确保LLM研究的有效性,公平性和临床实用性.
- 提供了建议,以提高医疗保健LLM研究中的报告标准和可复制性.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
相关概念视频
Improving Translational Accuracy
Improving Translational Accuracy
Language and Cognition
Types of Biopharmaceutical Studies: Controlled and Non-Controlled Approaches
Non-controlled studies, commonly employed for initial exploration, lack a control group, rendering them susceptible to biases and external influences. In contrast,...
Typical Model Studies
Longitudinal Research
