automatic speech recognition
- BlockDecoder: Boosting ASR Decoders with Context and Merger Modules
- E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
- Enabling Differentially Private Federated Learning for Speech Recognition: Benchmarks, Adaptive Optimizers, and Gradient Clipping
- Objective Soups: Multilingual Multi-Task Modeling for Speech Processing
- SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
- VITA-Audio: Fast Interleaved Audio-Text Token Generation for Efficient Large Speech-Language Model