| DC Field | Value | Language |
| dc.contributor.author | OMRANI, RAbah | - |
| dc.date.accessioned | 2026-10-08T07:56:21Z | - |
| dc.date.available | 2026-10-08T07:56:21Z | - |
| dc.date.issued | 2026 | - |
| dc.identifier.uri | https://repository.esi-sba.dz/jspui/handle/123456789/1001 | - |
| dc.description | Supervisor : Dr. Nassima Dif/Co-supervisor : Pr. Cédric Wemmert /Co-supervisor: Dr. Ali Ayadi | en_US |
| dc.description.abstract | The deployment of large neural networks on resource-constrained hardware has made
knowledge distillation, the transfer of knowledge from a large teacher model to a compact
student model, a central practical concern. Classical distillation methods remain fragile under
two conditions that have become routine in modern practice: large capacity gaps between
teacher and student, and architectural heterogeneity that prevents direct feature correspondence.
This thesis addresses both shortcomings by reformulating distillation as a problem
in the geometry of probability distributions. The central methodological contribution is a
unified training objective combining cross-entropy, temperature-scaled response distillation,
and an entropic optimal-transport loss acting on the empirical distributions of intermediate
features; dimensional mismatch is resolved by learnable linear projections, and structural
mismatch by an unbalanced transport extension. A complementary data-free pipeline synthesises
training data directly from the teacher’s parameters, preserving the distributional
and topological structure of its implicit data manifold through persistent homology. On
the theoretical side, we derive a Lipschitz bound relating the Wasserstein feature distance
to the Fisher-Rao output distance, together with a generalisation bound on the student’s
risk. Empirically, optimal-transport-regularised distillation improves over vanilla knowledge
distillation with high statistical significance, with the largest gains on cross-architecture and
extreme-compression scenarios, and the data-free pipeline recovers over ninety percent of
real-data distillation performance on standard benchmarks.***
Le déploiement de réseaux de neurones volumineux sur du matériel à ressources limitées a
fait de la distillation des connaissances, le transfert de connaissances d’un modèle enseignant
volumineux vers un modèle étudiant compact, une préoccupation pratique centrale. Les
méthodes classiques restent toutefois fragiles dans deux situations devenues courantes : un
écart de capacité important entre l’enseignant et l’étudiant, et une hétérogénéité architecturale
qui empêche toute correspondance directe des caractéristiques. Cette thèse aborde ces
deux limites en reformulant la distillation comme un problème de géométrie des distributions
de probabilité. La contribution méthodologique principale est un objectif d’entraînement
unifié combinant l’entropie croisée, la distillation des sorties mise à l’échelle par la température
et une perte de transport optimal entropique appliquée aux distributions empiriques des
caractéristiques intermédiaires ; les différences de dimension sont résolues par des projections
linéaires apprises, et l’hétérogénéité structurelle par une extension de transport déséquilibré.
Un pipeline complémentaire, sans données, synthétise les données d’entraînement directement
à partir des paramètres de l’enseignant, en préservant la structure géométrique et
topologique de sa variété de données implicite grâce à l’homologie persistante. Sur le plan
théorique, nous établissons une borne de Lipschitz reliant la distance de Wasserstein des
caractéristiques à la distance de Fisher-Rao des sorties, ainsi qu’une borne de généralisation
sur le risque de l’étudiant. Empiriquement, la distillation régularisée par transport optimal
surpasse la distillation classique avec une forte significativité statistique, les gains les plus
importants étant observés dans les scénarios inter-architectures et de compression extrême,
et le pipeline sans données récupère plus de quatre-vingt-dix pour cent des performances
obtenues avec les données réelles. | en_US |
| dc.language.iso | en | en_US |
| dc.subject | Optimal Transport | en_US |
| dc.subject | knowledge Dstillation | en_US |
| dc.subject | Model Compression | en_US |
| dc.subject | Student–Teacher Framework | en_US |
| dc.subject | Synthetic Data Generation | en_US |
| dc.subject | Information Geometry | en_US |
| dc.title | Optimal Transport-Regularised Knowledge Distillation and Synthetic Data Generation for Student–Teacher Model Compression | en_US |
| dc.type | Thesis | en_US |
| Appears in Collections: | Master
|