一个可扩展的框架,用于基准嵌入模型在语义医疗保健任务
Shelly Soffer1,2, Mahmud Omar3,4, Moran Gendler5
1Institute of Hematology, Davidoff Cancer Center, Rabin Medical Center, Petah Tikva, 49100, Israel.
Journal of the American Medical Informatics Association : JAMIA
|September 22, 2025
概括
一种新的比较方法评估了医疗保健语义任务的文本嵌入. 较大的模型在长时间的上下文检索中表现出色,而较小的模型在短时间的任务中表现相对较好.
科学领域:
- 自然语言处理自然语言处理.
- 生物医学信息学 生物医学信息学
- 机器学习 机器学习
背景情况:
- 文本嵌入对于语义任务至关重要,例如检索增强生成 (RAG).
- 文本嵌入的医疗保健应用受到缺乏标准化基准测试的限制.
- 现有的方法不足以评估嵌入模型在复杂的医疗保健场景.
研究的目的:
- 引入可扩展的基准测试方法,用于评估医疗保健中的文本嵌入模型.
- 评估各种嵌入模型在各种医学语义任务中的性能.
- 为医疗保健应用选择最佳嵌入模型提供框架.
主要方法:
- 在7个医学语义相似性任务中评估了39个嵌入模型.
- 利用了各种数据集,包括患者数据 (西奈山,MIMIC IV),PubMed文章和合成数据.
- 使用斯皮尔曼等级相关性评估语义文本相似性 (STS),并将任务重新定义为检索问题,通过平均互惠等级和k时的回忆评估.
主要成果:
- 较大的嵌入模型 (>7b参数) 通常优于较小的模型,特别是在长文本任务中.
- NV-Embed-v1 (7b) 在短任务中表现出色,但在长文本场景中表现不佳.
- 较小的模型 (例如,b1ade-embed,335M) 在短任务中与较大的模型相匹配,而较大的模型在长时间的检索任务中显著领先.
结论:
- 开发的基准测试框架对于医疗保健语义任务具有可扩展性和灵活性.
- 这种结构化的方法指导了为各种医疗保健应用选择合适的嵌入模型.
- 有效的模型选择增强了关键应用程序,如语义搜索和检索增强生成 (RAG).
相关概念视频
Improving Translational Accuracy
14.1K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.1K
Improving Translational Accuracy
3.6K
3.6K

