| DC Field | Value | Language |
| dc.contributor.author | BELMANA, SOufyane | - |
| dc.date.accessioned | 2026-10-08T08:15:19Z | - |
| dc.date.available | 2026-10-08T08:15:19Z | - |
| dc.date.issued | 2026 | - |
| dc.identifier.uri | https://repository.esi-sba.dz/jspui/handle/123456789/1004 | - |
| dc.description | Supervisor : Pr. AMAR BENSABER Djamel | en_US |
| dc.description.abstract | Automatic Speech Recognition (ASR) has undergone a remarkable transformation over
the past decade, driven primarily by advances in deep learning. This thesis presents a comprehensive
study of deep learning approaches for speech-to-text recognition, tracing the evolution
from traditional hybrid systems based on Hidden Markov Models (HMMs) and Gaussian
Mixture Models (GMMs) to modern end-to-end architectures powered by Transformers and
self-supervised learning.
We systematically analyze the major deep learning architectures that have been applied
to ASR, including Deep Neural Networks (DNNs), Convolutional Neural Networks (CNNs),
Recurrent Neural Networks (RNNs) with Long Short-Term Memory (LSTM) and Gated Recurrent
Unit (GRU) variants, attention mechanisms, and Transformer-based models such as
the Conformer. We examine the three main end-to-end paradigms—Connectionist Temporal
Classification (CTC), attention-based encoder-decoder models, and RNN-Transducers—
along with hybrid approaches that combine their strengths.
Furthermore, we investigate state-of-the-art systems including OpenAI’s Whisper, Meta’s
wav2vec 2.0, and Google’s Conformer, analyzing their architectures, training methodologies,
and performance characteristics. Our comparative analysis across standard benchmarks
demonstrates that modern systems have achieved Word Error Rates (WER) as low as 1.5%
on LibriSpeech, surpassing estimated human-level performance. We conclude by discussing
remaining challenges including robustness in adverse conditions, multilingual coverage, computational
efficiency, and fairness, as well as promising future research directions.***La reconnaissance automatique de la parole (RAP) a connu une transformation remarquable au
cours de la dernière décennie, principalement grâce aux avancées de l’apprentissage profond. Cette
thèse présente une étude approfondie des approches d’apprentissage profond pour la reconnaissance
vocale (conversion de la parole en texte), retraçant l’évolution depuis les systèmes hybrides traditionnels
basés sur les modèles de Markov cachés (HMM) et les modèles de mélange gaussien (GMM)
jusqu’aux architectures modernes de bout en bout alimentées par les Transformers et l’apprentissage
auto-supervisé.
Nous analysons systématiquement les principales architectures d’apprentissage profond appliquées
à la RAP, notamment les réseaux de neurones profonds (DNN), les réseaux de neurones
convolutifs (CNN), les réseaux de neurones récurrents (RNN) avec leurs variantes LSTM (Long
Short-Term Memory) et GRU (Gated Recurrent Unit), les mécanismes d’attention, ainsi que les
modèles basés sur les Transformers tels que le Conformer. Nous examinons les trois principaux
paradigmes de bout en bout : la Classification Temporelle Connexionniste (CTC), les modèles
encodeur-décodeur à base d’attention, et les RNN-Transducers, ainsi que les approches hybrides
combinant leurs forces.
En outre, nous étudions les systèmes à l’état de l’art, notamment Whisper d’OpenAI, wav2vec
2.0 de Meta et le Conformer de Google, en analysant leurs architectures, leurs méthodologies
d’entraînement et leurs caractéristiques de performance. Notre analyse comparative sur des benchmarks
standards démontre que les systèmes modernes ont atteint des taux d’erreur de mots (WER)
aussi bas que 1,5% sur LibriSpeech, dépassant les performances estimées au niveau humain. Nous
concluons en discutant les défis restants, notamment la robustesse dans des conditions défavorables,
la couverture multilingue, l’efficacité computationnelle et l’équité, ainsi que les directions de
recherche futures prometteuses. | en_US |
| dc.language.iso | en | en_US |
| dc.subject | Speech Recognition | en_US |
| dc.subject | Deep Learning | en_US |
| dc.subject | Automatic Speech Recognition (ASR) | en_US |
| dc.subject | Transformer | en_US |
| dc.subject | Convolutional Neural Networks (CNN) | en_US |
| dc.subject | Recurrent Neural Networks (RNN) | en_US |
| dc.subject | LSTM | en_US |
| dc.subject | Attention Mechanism | en_US |
| dc.subject | Connectionist Temporal Classification (CTC | en_US |
| dc.subject | Wav2vec 2.0 | en_US |
| dc.subject | Whisper | en_US |
| dc.subject | Conformer | en_US |
| dc.subject | Self-Supervised Learning | en_US |
| dc.subject | End-to-End Models | en_US |
| dc.title | A Comprehensive Study of Deep Learning Approaches for Speech-to-Text Recognition | en_US |
| dc.type | Thesis | en_US |
| Appears in Collections: | Master
|