使用大型语言模型工具,促进对DANDI档案上的开放神经生理学数据的分析
Jeremy F Magland1, Ryan Ly2, Oliver Rübel2
1Flatiron Institute, New York, NY, USA.
bioRxiv : the preprint server for biology
|August 8, 2025
概括
人工智能工具现在使探索开放的神经生理学数据变得更加容易. 一个人工智能聊天助理和自动笔记本生成器帮助研究人员访问和分析丹迪档案中的数据集,促进数据的重用.
科学领域:
- 神经科学是一个神经科学.
- 数据科学数据科学数据科学
- 计算生物学 计算生物学
背景情况:
- 丹迪档案馆拥有400多个开放的神经生理学数据集,采用无国界神经数据 (NWB) 格式.
- 研究人员在大型神经生理学数据集中访问和识别相关内容时面临挑战,这阻碍了数据的重用.
研究的目的:
- 开发和评估人工智能驱动的工具,以降低访问和分析开放神经生理学数据的障碍.
- 为丹迪档案增强FAIR (可查找,可访问,可互操作,可重复使用) 原则.
主要方法:
- 开发了一个由人工智能驱动的代理聊天助理,以指导用户通过数据探索,访问,可视化和初步分析.
- 创建了一个笔记本生成管道,自动分析数据集结构并生成针对特定数据集量身定制的教学Python笔记本.
- 该系统应用于最近的12个数据集,由神经生理学数据专家审查生成的笔记本.
主要成果:
- 人工智能聊天助理和笔记本生成管道成功应用于12个神经生理学数据集.
- 由数据专家生成的笔记本被发现通常是准确的和结构良好的.
- 大多数被审查的笔记本被神经生理学数据专家评为"非常有用".
结论:
- 由人工智能驱动的工具可以显著降低重复使用开放的神经生理学数据的障碍.
- 这些工具增强了用户与大规模数据集的互动,例如DANDI档案中的数据集.
- 开发的系统展示了一个可扩展的方法来改善神经科学研究中的数据可访问性和分析.


