Multimodal-Speech-Emotion-Recognition

A multimodal SER project combining BERT and ECAPA-TDNN with cross-attention-based fusion on the IEMOCAP dataset.

// repository documentation