一个用污水元基因组数据进行案例研究,以评估大型语言模型中的文本到SQL能力
Ágnes Becsei1, József Stéger1, Dávid Visontai1
1Department of Physics of Complex Systems, ELTE Eötvös Loránd University, Budapest, Hungary.
Scientific reports
|November 22, 2025
概括
大型语言模型可以将普通英语翻译为复杂数据库的SQL查询,为生命科学家简化数据分析. 人类监督对于准确的结果至关重要,特别是在模两可的问题上.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 数据科学数据科学数据科学
背景情况:
- 关系数据库对于复杂的数据来说很强大,但需要SQL专业知识,这对生命科学用户来说是一个障碍.
- 超基因组分析产生了庞大而复杂的数据集,使用传统方法对其进行查询具有挑战性.
研究的目的:
- 评估大型语言模型 (LLM) 在将普通英语查询翻译成SQL脚本 (Text-to-SQL) 的有效性.
- 评估LLM在简化数据库交互和克服生命科学中使用障碍方面的潜力.
主要方法:
- 利用了来自五个欧洲城市的239个污水样本的复杂基因组分析数据库.
- 一个专门的LLM"SewageGPT"提供了数据库结构和内容细节.
- 评估了LLM在回答复杂问题和可视化结果方面的准确性.
主要成果:
- 当提供详细描述时,SewageGPT准确地回应了复杂的数据库查询,加速了查询过程.
- 了解数据库内容可以尽量减少查询模两可,但模两可可能导致错误的响应.
- 人类监督对于确保准确性至关重要,特别是对于模糊或模两可的查询.
结论:
- 将LLM与直接数据库连接集成显著提高了查询生成,统计分析和结果可视化的效率.
- 对于没有广泛的SQL知识的研究人员来说,LLM提供了一个有希望的解决方案,以民主化对复杂的生物数据库的访问.
- 谨慎的快速工程和人类验证对于可靠的LLM数据分析至关重要.


