Jove
Visualize
联系我们
JoVE
x logofacebook logolinkedin logoyoutube logo
关于 JoVE
概览领导团队博客JoVE 帮助中心
作者
出版流程编辑委员会范围与政策同行评审常见问题投稿
图书馆员
用户评价订阅访问资源图书馆顾问委员会常见问题
研究
JoVE JournalMethods CollectionsJoVE Encyclopedia of Experiments存档
教育
JoVE CoreJoVE BusinessJoVE Science EducationJoVE Lab Manual教师资源中心教师网站
使用条款与条件
隐私政策
政策

相关概念视频

您也可能阅读

相关文章

通过共同作者、期刊和引用图与本文相关的文章。

排序
Same author

Multiaxial Fatigue Life Assessment of Large Welded Flange Shafts: A Continuum Damage Mechanics Approach.

Materials (Basel, Switzerland)·2025
Same author

GR-AttNet: Robotic grasping with lightweight spatial attention mechanism.

PloS one·2025
Same author

Dual-branch differential channel hypergraph convolutional network for human skeleton based action recognition.

PloS one·2025
Same author

MEP-YOLOv5s: Small-Target Detection Model for Unmanned Aerial Vehicle-Captured Images.

Sensors (Basel, Switzerland)·2025
Same author

Highly active and reversible NiPSe<sub>3</sub> anode for sodium-ion batteries: enabling ultrafast sodium storage with exceptional cycling stability.

Journal of colloid and interface science·2025
Same author

Use of BOIvy Optimization Algorithm-Based Machine Learning Models in Predicting the Compressive Strength of Bentonite Plastic Concrete.

Materials (Basel, Switzerland)·2025

相关实验视频

Updated: Jun 7, 2025

A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images
04:23

A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images

Published on: April 21, 2023

1.7K

LS-VIT:基于长期和短期时间差异的动作识别视觉转换器.

Dong Chen1,2,3, Peisong Wu1,3, Mingdong Chen1,3

  • 1College of Physics and Electronic Engineering, Nanning Normal University, Nanning, China.

Frontiers in neurorobotics
|November 15, 2024
PubMed
概括

本研究介绍了长期和短期时间差异视觉转换器 (LS-VIT),用于高效的3D视频动作识别. 通过在视频中有效捕捉短期和长期的运动细节,LS-VIT模型实现了高精度.

关键词:
视觉变压器 视觉变压器行动的认可行动的认可深度学习是一种深度学习.运动提取 提取 运动提取时间交叉融合 时间交叉融合

更多相关视频

Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility
07:46

Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility

Published on: August 9, 2024

651
Author Spotlight: Deciphering Electrical Networks Behind Complex Brain Activities and Disorders
05:49

Author Spotlight: Deciphering Electrical Networks Behind Complex Brain Activities and Disorders

Published on: November 1, 2024

717

相关实验视频

Last Updated: Jun 7, 2025

A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images
04:23

A Swin Transformer-Based Model for Thyroid Nodule Detection in Ultrasound Images

Published on: April 21, 2023

1.7K
Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility
07:46

Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility

Published on: August 9, 2024

651
Author Spotlight: Deciphering Electrical Networks Behind Complex Brain Activities and Disorders
05:49

Author Spotlight: Deciphering Electrical Networks Behind Complex Brain Activities and Disorders

Published on: November 1, 2024

717

科学领域:

  • 计算机视觉 计算机视觉
  • 人工智能的人工智能
  • 机器学习 机器学习

背景情况:

  • 变压器模型擅长2D视觉,但在3D视频任务中面临计算挑战,例如动作识别.
  • 直接将时间转换应用于3D视频数据,由于数据补丁乘法和复杂的自我注意力机制,增加了计算和内存需求.

研究的目的:

  • 开发一个高效和精确的3D自我注意模型用于视频动作识别.
  • 在3D视频分析中解决变压器模型所带来的计算挑战.

主要方法:

  • 介绍了长期和短期时间差异视觉变压器 (LS-VIT).
  • 通过对连续的差异进行加权,纳入了短期运动细节.
  • 集成了一个模块,用于长期的运动理解,使用运动激发和来自各种细分的时间差异.

主要成果:

  • 在多个基准标准上,LS-VIT实现了高识别精度,包括UCF101,HMDB51和Kinetics-400.
  • 该模型有效地模拟了视频中的短期和长期运动动态.

结论:

  • 在3D视频动作识别方面,LS-VIT表现出强的性能.
  • 该模型显示了进一步优化的潜力,以提高实时性能和行动预测能力.