评估已预训练的大型语言模型的搜索功能,用于PubChem数据库的检索任务
Ash Sze1, Soha Hassoun1,2
1Department of Computer Science, Tufts University, Medford, MA 02155, United States.
Bioinformatics advances
|May 14, 2025
概括
大型语言模型 (LLM) 可以简化生物数据库访问. 指示ChatGPT-4o生成PubChem数据检索的程序访问可以显著提高准确性和效率.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 数据科学数据科学数据科学
背景情况:
- 生物和生物医学研究在很大程度上依赖数据库进行数据管理.
- 目前的数据库访问方法通常是手动的,耗时的.
- 大型语言模型 (LLM) 为自动化和简化数据库交互提供了一个潜在的解决方案.
研究的目的:
- 为了评估预先训练的,启用搜索的LLM (ChatGPT-4o) 对于从PubChem数据库中检索数据的有效性.
- 开发和评估将PubChem访问协议集成到LLM提示符中的方法.
- 为了比较不同的LLM提示生物数据检索策略.
主要方法:
- 调查了八个已记录的PubChem访问协议.
- 开发了一个快速的工程方法,包括代的改进和上下文补充.
- 指示ChatGPT-4o生成用于数据检索的程序访问.
- 定量和质量评估的检索准确性.
主要成果:
- 指示ChatGPT-4o生成程序访问以从PubChem获取数据,可以获得更准确的结果.
- 开发的快速工程方法提高了LLM在访问生物数据库中的性能.
- 展示了LLM克服手动数据访问挑战的潜力.
结论:
- LLM,特别是ChatGPT-4o,显示出改变生物数据库访问的重大前景.
- 通过LLM提示程序生成程序访问是一种更有效的策略,用于准确的数据检索.
- 未来的研究应该专注于进一步开发LLM,以实现无和高效的数据库交互.
更多相关视频
10:21Author Spotlight: Streamlining Protein Target Prediction and Validation via Molecular Docking and CETSA
Published on: February 23, 2024
2.3K
06:50Author Spotlight: A Computational Approach to Decipher Amino Acid Preferences in Multispecific Protein-Protein Interactions
Published on: January 26, 2024
972
