评估一个大气层的大型语言模型的性能,使用自动提取数据集
Shiqin Dai1,2, Qingru Wu1,2, Haowen Zhang1,2
1School of Environment, State Key Laboratory of Regional Environment and Sustainability, School of Environment, Tsinghua University, Beijing 100084, P. R. China.
Environmental science & technology
|December 31, 2025
概括
大型语言模型 (LLM) 对大气科学有前途,但在空气污染控制任务中难以准确和幻觉率. 特定领域的适应对于可靠的LLM在环境决策中的部署至关重要.
科学领域:
- 大气科学 大气科学
- 环境科学环境科学
- 人工智能的人工智能是人工智能.
背景情况:
- 大型语言模型 (LLM) 为推进大气研究和空气污染控制提供了潜力.
- 缺乏系统评估基准,阻碍了对LLM的信任和对关键环境任务的实际部署.
研究的目的:
- 开发和使用一个基准数据集 (OneAtmos-Bench) 来评估空气污染控制中的LLM.
- 评估11个LLM在大气领域的准确性,遵循指令和幻觉率方面的表现.
主要方法:
- 一个两阶段的自动提取管道被用来创建OneAtmos-Bench数据集.
- 使用OneAtmos-Bench数据集评估了11个LLM,重点关注准确性,遵循指令 (IF) 和幻觉率 (HR).
- 专家验证证实了数据集的高准确性 (95.88%).
主要成果:
- 在此期间,LLMs表现出强大的指令遵循能力.
- 准确性和抑制幻觉仍然是挑战,特别是在专门的大气任务中.
- 模型缩放显示了有限的收益,表明域适应稀疏;微调方法可能会增加幻觉率.
结论:
- 一般用途的LLM面临可靠性问题,可靠的,低幻觉的空气污染控制指导.
- 环境特定的适应是必要的,以克服当前的LLM在大气科学应用中的局限性.
- 需要进一步的研究来提高LLM对环境决策的可信度.
相关概念视频
Improving Translational Accuracy
3.5K
3.5K
Improving Translational Accuracy
14.0K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.0K

