Semi-supervised audio-driven TV-news speaker diarization using deep neural embeddings.

Nikolaos Tsipas1, Lazaros Vrysis1, Konstantinos Konstantoudakis1

  • 1Aristotle University of Thessaloniki, Thessaloniki, Greece.

Summary

This study introduces a novel audio-visual method for speaker diarization, enhancing multimedia content analysis. The approach uses deep learning embeddings and a fusion stage for improved accuracy in identifying different speakers.

Related Concept Videos