| DC Field | Value | Language |
| dc.contributor.author | BOUCHETA, ZAhra | - |
| dc.date.accessioned | 2026-10-06T07:53:30Z | - |
| dc.date.available | 2026-10-06T07:53:30Z | - |
| dc.date.issued | 2026 | - |
| dc.identifier.uri | https://repository.esi-sba.dz/jspui/handle/123456789/962 | - |
| dc.description | Supervisor : Dr. CHAIB Souleyman | en_US |
| dc.description.abstract | Large language models (LLMs) have increasingly been integrated into Text-to-SQL
systems, enabling the transformation of natural language specifications into executable SQL
queries over structured data sources. Despite notable advances in this direction, a persistent
gap remains between the performance of current automated approaches and the capabilities
exhibited by expert users in realistic database interaction scenarios.
This study undertakes a systematic comparative analysis of eight state-of-the-art
Text-to-SQL frameworks, evaluated under the BIRD benchmark, which is designed to
reflect complex, real-world database reasoning and query generation tasks. The examined
systems are analyzed along multiple dimensions, including architectural design paradigms,
benchmark performance, computational efficiency, and training methodologies.
The empirical findings suggest that performance gains are more strongly associated
with system-level design choices and orchestration strategies than with increases in
model scale alone. In addition, approaches incorporating reinforcement learning exhibit
improved compositional generalization when compared to conventional supervised fine-tuning
paradigms.
Furthermore, schema grounding emerges as a central unresolved challenge across
all evaluated systems, with preliminary estimates indicating potential improvements of
approximately five percentage points in execution accuracy if adequately addressed [1].
Although the strongest-performing system achieves an execution accuracy of 81.67%,
a measurable gap remains relative to estimated human performance, on the order of
approximately eleven percentage points. These observations suggest that the development of
robust and generalizable natural language interfaces for complex database systems continues
to constitute an open research problem.***
Les grands modèles de langage (Large Language Models, LLMs) sont désormais largement
intégrés aux systèmes Text-to-SQL, permettant la traduction de requêtes exprimées en
langage naturel en requêtes SQL exécutables sur des bases de données relationnelles. Malgré
les progrès significatifs réalisés dans ce domaine, un écart de performance persistant subsiste
entre les approches automatisées actuelles et les capacités démontrées par des experts
humains dans des environnements réalistes d’interrogation de bases de données.
Cette étude propose une analyse comparative systématique de huit systèmes Text-to-SQL
de l’état de l’art, évalués sur le benchmark BIRD, conçu pour représenter des scénarios
complexes et réalistes de raisonnement sur bases de données et de génération de requêtes SQL.
Les systèmes étudiés sont analysés selon plusieurs dimensions, notamment leurs paradigmes
architecturaux, leurs performances sur benchmark, leur efficacité computationnelle, ainsi que
leurs stratégies d’entraînement et d’inférence.
Les résultats expérimentaux montrent que les gains de performance sont principalement
attribuables aux choix d’architecture système et aux stratégies d’orchestration, plutôt qu’à
l’augmentation de la taille des modèles à elle seule. Par ailleurs, les approches basées
sur l’apprentissage par renforcement présentent une meilleure capacité de généralisation
compositionnelle que les méthodes classiques de fine-tuning supervisé.
En outre, l’ancrage au schéma (schema linking) apparaît comme un défi fondamental
non résolu dans l’ensemble des systèmes étudiés. Des estimations préliminaires suggèrent que
son amélioration pourrait conduire à un gain d’environ cinq points de pourcentage en exact
match execution accuracy [1]. Bien que le système le plus performant atteigne une exactitude
d’exécution de 81,67 %, un écart significatif subsiste par rapport à la performance humaine
estimée, de l’ordre d’environ onze points de pourcentage. Ces résultats soulignent que la
conception d’interfaces en langage naturel robustes et généralisables pour des systèmes de
bases de données complexes demeure un problème de recherche ouvert. | en_US |
| dc.language.iso | en | en_US |
| dc.subject | Text-to-SQL | en_US |
| dc.subject | Large Language Models | en_US |
| dc.subject | BIRD Benchmark | en_US |
| dc.subject | Schema Linking | en_US |
| dc.subject | Reinforcement Learning | en_US |
| dc.subject | Test-Time Scaling | en_US |
| dc.subject | Execution Accuracy | en_US |
| dc.subject | Natural Language Interfaces to Databases | en_US |
| dc.title | A Comparative Study of Text-to-SQL Systems on the BIRD Benchmark | en_US |
| dc.type | Thesis | en_US |
| Appears in Collections: | Ingenieur
|