端到端流媒体视频 时间动作细分与强化学习加强学习
IEEE transactions on neural networks and learning systems
|April 11, 2025
概括
这项研究引入了一种新的流动时间动作细分 (STAS) 模型,使在线视频分析成为可能. 拟议的SVTAS-RL方法克服了现有技术的局限性,提高了未修剪的视频序列的性能.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 时间动作细分 (TAS) 对于视频理解至关重要,但通常在线运行.
- 由于依赖完整的数据和多式联运功能,现有的TAS方法与在线场景作斗争.
- 流式时间动作细分 (STAS) 将TAS扩展到在线设置,顺序分类.
研究的目的:
- 解决现有方法对STAS任务的关注不足和表现不佳的问题.
- 分析STAS和TAS之间的根本差异,并确定性能下降的原因.
- 为STAS引入一个有效的端到端模型,适用于在线视频分析.
主要方法:
- 开发了一种具有强化学习 (SVTAS-RL) 的全新端到端流式视频TAS模型.
- 利用强化学习 (RL) 来克服在线学习中固有的优化困境.
- 设计模型以减轻因离线转向在线任务性质而产生的偏见.
主要成果:
- 该SVTAS-RL模型显著优于现有的STAS方法.
- 与多个数据集上的最先进的TAS模型相比,实现了竞争性表现.
- 在超长视频数据集EGTEA上展示了显著的优势,验证了其对长形式内容的有效性.
结论:
- 该SVTAS-RL模型有效地解决了流动时间动作细分的挑战.
- 端到端建模和强化学习是成功在线视频分析的关键.
- 拟议的方法为实时视频理解应用提供了可行的解决方案.


