一个基于视觉的字幕生成器:通过视频中的微妙振动来重建文本
Yan Wang1, Yingchong Wang1, Xiuqi Zhang1
1School of Mechanical Engineering, Beijing Institute of Technology, Haidian District, Beijing 100081, China.
Sensors (Basel, Switzerland)
|March 14, 2026
概括
本研究介绍了一种基于视觉的字幕生成器 (VSG),该生成器将声音诱导的物体振动转换为文本. 这种新的方法使用基于相位的运动估计和变压器架构来从视觉数据中准确地恢复语音.
科学领域:
- 计算机视觉 计算机视觉
- 声学 声学 在声学上
- 信号处理 信号处理
背景情况:
- 环境声音,特别是语音,会在日常物体中引起微妙的振动.
- 这些振动包含声学线索,可以被潜在地解码成文本.
- 在监控和安全方面存在应用.
研究的目的:
- 为了介绍基于视觉的字幕生成器 (VSG).
- 通过使用生成方法,从声感应物体振动的高速视频中直接恢复文本.
- 为了减少对大量视频数据的依赖,用于培训.
主要方法:
- 引入了基于相位的运动估计 (PME) 技术,将像素视为"独立麦克风",以提取伪声学信号.
- 使用预训练的隐藏单元双向编码器表示来自变压器 (HuBERT) 作为VSG-变压器架构的编码器.
- 用杆生成方法将振动转换为文本.
主要成果:
- 实现了13.7% (基本) 和12.5% (大) 的字符错误率,用于从芯片袋振动生成文本.
- 证明了生成方法在振动到文本转录中的有效性.
- 展示了降低采样率的稳定性,在有限的时间采样下保持性能.
结论:
- 该VSG-变压器有效地从声音诱导的物体振动中恢复文本.
- 提出的方法大大减少了对大量视频数据集的需求.
- 该系统在各种音响环境中显示出对现实世界应用的希望.
