使用大型语言模型工具,促进对DANDI档案上的开放神经生理学数据的分析
Jeremy F Magland1, Ryan Ly2, Oliver Rübel2
1Flatiron Institute, New York, NY, USA. jmagland@flatironinstitute.org.
Scientific data
|December 16, 2025
概括
人工智能工具现在使探索开放的神经生理学数据变得更加容易. 人工智能聊天助理和自动笔记本生成器帮助研究人员访问,可视化和分析DANDI档案中的数据集,促进数据的重复使用.
科学领域:
- 神经科学是一个神经科学.
- 数据科学数据科学数据科学
- 计算生物学 计算生物学
背景情况:
- 丹迪档案馆拥有400多个开放的神经生理学数据集,采用无国界神经数据 (NWB) 格式.
- 由于对方法和内容不熟悉,研究人员在访问和识别相关的神经生理学数据以重复使用方面面临挑战.
- 促进数据的再利用对于推动科学发现和遵守FAIR数据原则至关重要.
研究的目的:
- 开发和评估人工智能驱动的工具,以降低在DANDI档案中访问和重复使用神经生理学数据的障碍.
- 通过自动化辅助和指导分析,增强用户对开放的神经生理学数据集的参与度.
主要方法:
- 开发了一个由人工智能驱动的代理聊天助理,以指导用户通过数据探索,访问,可视化和初步分析.
- 创建了一个笔记本生成管道,自动分析数据集结构,执行检查脚本,并生成可视化.
- 该系统应用于最近的12个DANDI数据集,并由神经生理学数据专家审查生成的笔记本.
主要成果:
- 人工智能聊天助理和笔记本生成器成功应用于12个神经生理学数据集.
- 由数据专家生成的Python笔记本被发现通常是准确的和结构良好的.
- 大多数被审查的笔记本被神经生理学数据专家评为"非常有用".
结论:
- 由人工智能驱动的工具可以显著降低重复使用开放的神经生理学数据的障碍.
- 自动化分析和指导式勘探可提高数据的可访问性和参与度,支持FAIR数据原则.
- 这种方法证明了人工智能的潜力,可以简化神经科学研究中的数据分析工作流程.


