在教学视频中准确规划程序:视觉状态生成有助于任务选择性扩散
IEEE transactions on pattern analysis and machine intelligence
|December 9, 2025
概括
本研究引入了在教学视频中程序规划的新方法,解决了视觉观察和行动选择中的不确定性. 该方法通过合成中间状态和限制行动空间以提高性能来增强动作预测.
科学领域:
- 计算机科学 计算机科学
- 机器人技术 机器人技术 机器人技术
- 人工智能的人工智能
背景情况:
- 在教学视频中程序规划是复杂的,因为视觉数据有限,行动可能性广.
- 现有的方法往往隐性地处理不确定性,从而导致低于最佳的性能.
研究的目的:
- 为程序规划开发明确的解决方案,以解决视觉观察和决策空间中的不确定性.
- 为提高教学视频预测动作序列的准确性和效率.
主要方法:
- 在扩散模型中利用图像生成模型和提示选择模块来合成各种中间视觉状态.
- 引入了一种任务选择性扩散模型,带有特定任务的面具来限制行动空间.
- 使用预先训练的视觉语言模型进行增强的视觉表示,以实现动作意识,文本丰富的多式联络嵌入.
主要成果:
- 与以前的方法相比,拟议的方法在基准数据集上表现优越.
- 合成状态和受约束的行动空间的组合显著提高了程序规划的准确性.
- 行动意识的多式联运嵌入增强了任务分类和随后的行动预测.
结论:
- 开发的方法有效地减轻了视觉观察和程序规划决策空间的不确定性.
- 这种明确的方法在为教学视频生成准确和上下文相关的动作序列方面取得了重大进展.
- 这些发现对机器人,人工智能驱动的指令和自动化任务执行有影响.
更多相关视频
08:25Combining Eye-tracking Data with an Analysis of Video Content from Free-viewing a Video of a Walk in an Urban Park Environment
Published on: May 7, 2019
9.5K
09:27Using Eye Movements Recorded in the Visual World Paradigm to Explore the Online Processing of Spoken Language
Published on: October 13, 2018
10.6K
