视听时刻:视听行动的大规模注释数据集
Michael Joannou1, Pia Rotshtein1,2, Uta Noppeney1,3
1Computational Neuroscience and Cognitive Robotics Centre, University of Birmingham, Birmingham, United Kingdom.
PloS one
|April 1, 2024
概括
视听时刻 (AVMIT) 数据集增强了视听事件的识别. 基于AVMIT数据的培训模型显著提高了行动识别和跨模式学习任务的准确性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 大规模的视听数据集对于开发先进的AI模型至关重要.
- 现有的数据集可能缺乏足够的细节或专注于特定的视听行动事件.
- 时间中的时刻 (MIT) 数据集为视听研究提供了基础.
研究的目的:
- 引入视听时刻 (AVMIT) 数据集,这是一个大规模的视听行动事件资源.
- 为音频和视觉数据提供预计算的功能嵌入,以促进研究.
- 评估AVMIT注释和嵌入对视听事件识别和跨模式学习的影响.
主要方法:
- 从麻省理工学院数据集收集和注释了57,177个视频视频,每个视频有3个独立评估.
- 创建了一个精心策划的测试集,包含16个不同的动作类别中的960个视频.
- 使用VGGish/YamNet进行音频和VGG16/EfficientNetB0进行视觉功能嵌入.
- 在AVMIT过和模态不可知数据上训练反复的神经网络 (RNN),用于事件识别和跨模态学习任务 (监督视听通信 - SAVC).
主要成果:
- 仅在AVMIT过的视听事件上训练RNN,对事件识别的top-1准确度提高了2.71-5.94%,优于在较大,模态不可知数据集上训练的模型.
- 使用AVMIT过数据时,监督视听通信 (SAVC) 任务的准确性提高了2.09-19.16%,证明了其对跨模式学习的有效性.
- AVMIT数据集和功能嵌入降低了对视听深度神经网络研究的障碍.
结论:
- AVMIT数据集是促进视听研究的宝贵资源,特别是理解视听通信.
- AVMIT注释和特征嵌入显著提高了在视听事件识别和跨模式学习中的计算模型的性能.
- 这一数据集将促进未来的研究和比较研究,涉及人工智能模型和人类参与者.
更多相关视频
相关概念视频
Fixed Action Patterns
A fixed action pattern (FAP) is a specific, hard-wired sequence of behaviors that occurs in response to an external stimulus, called a sign stimulus. The behavior is “fixed” because it is essentially unchangeable—proceeding similarly across individuals of a species every time it occurs.
Automatic Processing and Automatic Social Behavior
Automatic processing refers to the cognitive operations that occur without conscious intent or awareness, playing a fundamental role in shaping social cognition and behavior. These processes enable individuals to navigate complex social environments efficiently by relying on mental shortcuts and pre-existing knowledge structures known as schemas. One of the most influential mechanisms underlying automatic processing is priming, which subtly activates mental representations through exposure to...


