:

Yan Wang1, Yingchong Wang1, Xiuqi Zhang1

  • 1School of Mechanical Engineering, Beijing Institute of Technology, Haidian District, Beijing 100081, China.

PubMed
概括

本研究介绍了一种基于视觉的字幕生成器 (VSG),该生成器将声音诱导的物体振动转换为文本. 这种新的方法使用基于相位的运动估计和变压器架构来从视觉数据中准确地恢复语音.