A speech-to-video synthesis approach using spatio-temporal diffusion for vocal tract MRI

Paula Andrea Pérez-Toro1, Tomás Arias-Vergara1, Fangxu Xing2

  • 1Harvard Medical School/Massachusetts General Hospital, Boston, 02114, Massachusetts, USA; Pattern Recognition Lab, Department of Computer Science, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, 91058, Bayern, Germany; GITA Lab, Faculty of Engineering, Universidad de Antioquia, Medellín, 050010, Antioquia, Colombia.