单细胞奥米克领域:通过RNA-seq桥接对单细胞奥米克数据进行自动细胞类型注释的大型语言模型的评估
Junhao Liu1, Siwei Xu1, Yongxian Wu2
1Department of Computer Science, University of California, Irvine, 6210 Donald Bren Hall, Irvine, CA 92697, United States.
Briefings in bioinformatics
|November 24, 2025
概括
大型语言模型 (LLM) 可以从单细胞RNA测序数据中自动化细胞类型注释. 一个新的基准,单细胞Omics竞技场,评估LLMs,并介绍了提高准确性和跨模式应用的方法.
科学领域:
- 单细胞基因组学 单细胞基因组学
- 计算生物学是一种计算生物学.
- 生物学中的人工智能
背景情况:
- 单细胞测序允许进行详细的组织分析,但细胞类型的注释是具有挑战性的.
- 需要自动化方法来克服劳动密集型,专家驱动的细胞识别.
- 大型语言模型 (LLM) 在提取生物知识和自动化注释方面表现有前途.
研究的目的:
- 评估现代LLM用于自动化细胞类型注释的有效性.
- 建立一个全面的基准来评估单细胞RNA测序 (scRNA-seq) 数据上的LLM性能.
- 开发先进的提示技术和跨模式翻译,以改善注释.
主要方法:
- 编译了11个scRNA-seq数据集和1226个标注任务用于基准测试.
- 对八种不同的LLM进行了评估,以评估它们的细胞类型注释能力.
- 开发了特定领域的思维链提示和基于VAE的跨模式翻译.
主要成果:
- 建立了单细胞Omics竞技场的基准,用于评估LLM在细胞类型注释中.
- 证明了LLM能够使用可解释的特征 (如基因名称) 来执行自动化的细胞类型注释的能力.
- 通过思维链提示展示了增强的准确性,并扩展了对使用VAE的非RNA数据的适用性.
结论:
- 在scRNA-seq数据中,LLM为自动化细胞类型注释提供了强大的工具.
- 单细胞Omics竞技场基准为LLM绩效提供了有价值的见解.
- 跨模式翻译使LLM能够应用于各种单细胞数据类型.


