将免疫细胞序列与大型语言模型协调用于计算分析
Areej Alsaafin1, Hamid R Tizhoosh1
1Department of Artificial Intelligence & Informatics, KIMIA Lab, Mayo Clinic, Rochester, MN, 55905, United States.
Biology methods & protocols
|September 18, 2024
概括
Seqwash协调了大型语言模型 (LLM) 的免疫细胞序列,提高了数据质量. 这种标准化提高了数据分析序列的下游任务性能.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 免疫信息学是指免疫信息学.
背景情况:
- 免疫细胞测序产生复杂的数据.
- 标准化测序资料对于准确的分析至关重要.
- 大型语言模型 (LLM) 为生物数据中的模式识别提供了潜力.
研究的目的:
- 引入Seqwash (用于排序和协调的SEQuence加权对齐),用于处理序列配置文件的算法.
- 为了使免疫细胞序列协调为LLM分析的统一表示.
- 通过使用标准化测序数据来提高功能质量和下游任务性能.
主要方法:
- 开发了Seqwash算法的开发.
- Seqwash对免疫细胞测序数据的应用.
- 使用LLM进行模式嵌入和信息过.
主要成果:
- Seqwash有效地协调了免疫细胞测序配置文件.
- 标准化配置文件显示了功能质量的提高.
- 在监督和无监督下游测序数据任务中观察到更好的性能.
结论:
- 排列清洗是标准化免疫细胞测序数据的有效工具.
- 该算法使LLM能够识别生物序列中的有意义模式.
- 序列清洗有助于改进对测序数据的下游分析.


