Summary

This study introduces a hierarchical decoding framework for speech perception using M/EEG signals. Integrating mel-spectrogram, Wav2vec 2.0, and GPT-2 representations significantly improved decoding accuracy, outperforming previous methods.