对大型语言模型进行基准测试,以识别转录因子调节相互作用.
Lake Noel1, Yi-Wen Hsiao1, Yimeng He1,2
1Department of Computational Biomedicine, Cedars-Sinai Medical Center, Los Angeles, CA 90048, United States.
大型语言模型 (LLM) 对识别转录因子 (TF) 目标基因相互作用显示出希望. 克劳德3.5索内特和GPT-4o表现出强的表现,迅速的工程显著提高了监管生物学研究的准确性.
科学领域:
- 计算生物学 计算生物学
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
背景情况:
- 转录因子 (TF) 和它们的基因协调基因表达,影响生物过程和疾病.
- 现有的识别TF-目标相互作用的方法通常需要专门的计算专业知识.
- 大型语言模型 (LLM) 为查询这些复杂的监管关系提供了更容易获得的方法.
研究的目的:
- 为了比较著名的LLM在识别人类TF-目标相互作用方面的表现.
- 评估快速工程和模型参数对TF-target预测的LLM精度的影响.
- 评估不同类型的监管互动 (双向,模两可,自我监管,单向) 的LLM能力.
主要方法:
- 使用文献策划 (8432次互动) 和实验衍生 (5148次互动) 人类TF目标数据集进行四个LLM (Claude 3.5 Sonnet,Gemini 1.0 Pro,GPT-4o,Llama3 8b) 的基准测试.
- 分析基于单回合和多回合查询以及零温度设置的性能.
- 评估四个监管类别的准确性:双向,模两可,自我监管和单向.
主要成果:
- 克劳德3.5索内特和GPT-4o在单回合查询中表现出竞争力.
- 多个转促使一些模型的准确性显著提高,特别是克劳德3.5索内特在自我调节对 (+32.6%) 上.
- 除了未知的调节类型,提高了准确性,单向调节达到近70%的平衡准确性.
- 克劳德3.5索内特在各种条件下与实验推导的相互作用中始终优于其他模型.
结论:
- 在监管生物学中,LLM聊天机器人,特别是Claude 3.5 Sonnet,显示了TF-target交互识别的巨大潜力.
- 快速工程和参数调整对于优化LLM在这个领域的性能至关重要.
- 这些发现建立了一个基准测试框架,并强调了一般目的LLM对于缺乏专业计算专业知识的研究人员的实用性.
更多相关视频
11:25Enhanced Yeast One-hybrid Screens To Identify Transcription Factor Binding To Human DNA Sequences
Published on: February 11, 2019
11:32Identification of Transcription Factor Regulators using Medium-Throughput Screening of Arrayed Libraries and a Dual-Luciferase-Based Reporter
Published on: March 27, 2020
相关概念视频
Cooperative Binding of Transcription Regulators
Cooperative Binding of Transcription Regulators
Master Transcription Regulators
Master Transcription Regulators
Transcription Factors
General Transcription Factors
