对基于生物标志物的个性化卫生干预建议进行大型语言模型的基准测试
Hans Jarchow1, Christoph Bobrowski2, Steffi Falk3
1Institute for Biostatistics and Informatics in Medicine and Ageing Research, Rostock University Medical Center, Rostock, Germany.
NPJ digital medicine
|October 28, 2025
概括
大型语言模型 (LLM) 对个性化长寿建议的适用性有限. 虽然专有模型的表现更好,但在这项研究中,所有LLM都在医学验证,稳定性和年龄偏差方面扎.
科学领域:
- 人工智能在医学中的应用
- 生物医学信息学 生物医学信息学
- 计算生物学 计算生物学
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地使用,但它们对个性化的长寿干预措施的有效性尚不清楚.
- 现有的评估AI在医学中的框架往往不涵盖生成个性化健康建议的细微差别.
研究的目的:
- 用扩展的BioChatter框架对LLM在生成个性化长寿干预建议方面的表现进行基准测试.
- 评估LLM对健康建议的关键医学验证要求的遵守.
主要方法:
- 开发并使用了一个扩展的BioChatter框架来对LLMs进行基准测试.
- 从三个年龄组的25个个人资料中创建了1000个不同的测试案例,涵盖了热量限制,禁食和补充剂等干预措施.
- 使用LLM-as-a-Judge系统对临床医生验证的基本真相进行了评估,56,000个模型响应.
主要成果:
- 专有LLM通常在长寿建议的全面性方面优于开源模型.
- 所有评估的LLM,即使是Retrieval-Augmented Generation (RAG),在满足医疗验证标准,快速稳定性和解决与年龄相关的偏见方面也存在局限性.
- 该研究发现,在使用LLM来无监督生成长寿建议方面存在重大挑战.
结论:
- 由于医学验证,稳定性和偏见的问题,目前的LLM对无监督的个性化长寿干预建议的适用性有限.
- 开发的开源框架为未来AI在医疗应用中的基准测试提供了基础.
- 需要进一步的研究来完善LLM,以提供安全有效的个性化健康指导.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
07:35Selecting Multiple Biomarker Subsets with Similarly Effective Binary Classification Performances
Published on: October 11, 2018
7.9K
