https://repository.esi-sba.dz/jspui/handle/123456789/1004| Title: | A Comprehensive Study of Deep Learning Approaches for Speech-to-Text Recognition |
| Authors: | BELMANA, SOufyane |
| Keywords: | Speech Recognition Deep Learning Automatic Speech Recognition (ASR) Transformer Convolutional Neural Networks (CNN) Recurrent Neural Networks (RNN) LSTM Attention Mechanism Connectionist Temporal Classification (CTC Wav2vec 2.0 Whisper Conformer Self-Supervised Learning End-to-End Models |
| Issue Date: | 2026 |
| Abstract: | Automatic Speech Recognition (ASR) has undergone a remarkable transformation over the past decade, driven primarily by advances in deep learning. This thesis presents a comprehensive study of deep learning approaches for speech-to-text recognition, tracing the evolution from traditional hybrid systems based on Hidden Markov Models (HMMs) and Gaussian Mixture Models (GMMs) to modern end-to-end architectures powered by Transformers and self-supervised learning. We systematically analyze the major deep learning architectures that have been applied to ASR, including Deep Neural Networks (DNNs), Convolutional Neural Networks (CNNs), Recurrent Neural Networks (RNNs) with Long Short-Term Memory (LSTM) and Gated Recurrent Unit (GRU) variants, attention mechanisms, and Transformer-based models such as the Conformer. We examine the three main end-to-end paradigms—Connectionist Temporal Classification (CTC), attention-based encoder-decoder models, and RNN-Transducers— along with hybrid approaches that combine their strengths. Furthermore, we investigate state-of-the-art systems including OpenAI’s Whisper, Meta’s wav2vec 2.0, and Google’s Conformer, analyzing their architectures, training methodologies, and performance characteristics. Our comparative analysis across standard benchmarks demonstrates that modern systems have achieved Word Error Rates (WER) as low as 1.5% on LibriSpeech, surpassing estimated human-level performance. We conclude by discussing remaining challenges including robustness in adverse conditions, multilingual coverage, computational efficiency, and fairness, as well as promising future research directions.***La reconnaissance automatique de la parole (RAP) a connu une transformation remarquable au cours de la dernière décennie, principalement grâce aux avancées de l’apprentissage profond. Cette thèse présente une étude approfondie des approches d’apprentissage profond pour la reconnaissance vocale (conversion de la parole en texte), retraçant l’évolution depuis les systèmes hybrides traditionnels basés sur les modèles de Markov cachés (HMM) et les modèles de mélange gaussien (GMM) jusqu’aux architectures modernes de bout en bout alimentées par les Transformers et l’apprentissage auto-supervisé. Nous analysons systématiquement les principales architectures d’apprentissage profond appliquées à la RAP, notamment les réseaux de neurones profonds (DNN), les réseaux de neurones convolutifs (CNN), les réseaux de neurones récurrents (RNN) avec leurs variantes LSTM (Long Short-Term Memory) et GRU (Gated Recurrent Unit), les mécanismes d’attention, ainsi que les modèles basés sur les Transformers tels que le Conformer. Nous examinons les trois principaux paradigmes de bout en bout : la Classification Temporelle Connexionniste (CTC), les modèles encodeur-décodeur à base d’attention, et les RNN-Transducers, ainsi que les approches hybrides combinant leurs forces. En outre, nous étudions les systèmes à l’état de l’art, notamment Whisper d’OpenAI, wav2vec 2.0 de Meta et le Conformer de Google, en analysant leurs architectures, leurs méthodologies d’entraînement et leurs caractéristiques de performance. Notre analyse comparative sur des benchmarks standards démontre que les systèmes modernes ont atteint des taux d’erreur de mots (WER) aussi bas que 1,5% sur LibriSpeech, dépassant les performances estimées au niveau humain. Nous concluons en discutant les défis restants, notamment la robustesse dans des conditions défavorables, la couverture multilingue, l’efficacité computationnelle et l’équité, ainsi que les directions de recherche futures prometteuses. |
| Description: | Supervisor : Pr. AMAR BENSABER Djamel |
| URI: | https://repository.esi-sba.dz/jspui/handle/123456789/1004 |
| Appears in Collections: | Master |
| File | Description | Size | Format | |
|---|---|---|---|---|
| Master_BELMANA_Soufyane-1-1.pdf | 84,27 kB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.