长期健康:一个问答基准与长期临床文档
Lisa Adams1, Felix Busch1,2, Tianyu Han3
1Institute for Diagnostic and Interventional Radiology, School of Medicine and Health, TUM University Hospital, Technical University of Munich (TUM), Ismaninger Str. 22, Munich, 81675 Germany.
大型语言模型 (LLM) 对处理冗长的临床数据有希望,但目前的准确性不足以可靠地用于医疗保健. 新的长期健康基准揭示了在识别缺失的患者信息方面存在重大斗争.
科学领域:
- 医疗保健中的人工智能
- 临床数据的自然语言处理.
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 提供了分析大量患者记录的潜力.
- 现有的基准不充分评估在现实世界,漫长的临床数据LLM的表现.
研究的目的:
- 引入长期健康基准来评估长期临床文档上的LLM.
- 评估各种LLM在处理和解释复杂患者病例文件方面的能力.
主要方法:
- 开发了长期健康基准,其中包括20个详细的虚构患者病例 (每一个5090-6754字).
- 在信息提取,否定和排序任务中创建了400个多选题.
- 在基准上评估了11个开源LLM和GPT-3.5 Turbo.
主要成果:
- 导弹-24B-Instruct-2501和拉玛-4-Scout-17B-16E-Instruct实现了最高的准确性,特别是在信息检索方面.
- 所有评估的模型都表明,在临床文档中识别缺失信息方面存在重大困难.
- 目前的LLM准确性不足以确保安全可靠的临床应用.
结论:
- LLM具有处理长篇临床文档的潜力,但需要在医疗保健方面进一步改进.
- 长期健康基准提供了对临床环境中LLM绩效的现实评估.
- 未来的研究应该专注于提高在识别缺失的临床数据时的LLM准确性.
更多相关视频
07:26Executing Complexity-Increasing Queries in Relational MySQL and NoSQL MongoDB and EXist Size-Growing ISO/EN 13606 Standardized EHR Databases
Published on: March 19, 2018
09:20Cloud-Based Phrase Mining and Analysis of User-Defined Phrase-Category Association in Biomedical Publications
Published on: February 23, 2019
相关概念视频
Documentation in Long-Term and Home Healthcare Setting
Long-Term Care Facilities
Longitudinal Studies
Longitudinal Research
Methods of Documentation II: POMR
Methods of Documentation VI: Case Management Model
For example, a patient with a chronic...
Purpose of Health Records I
Here's a breakdown of how health records serve these purposes:
