This repo contains implementation of different architectures for emotion recognition in conversations.
A family of diffusion models for text-to-audio generation.