Skip navigation
Please use this identifier to cite or link to this item: https://repository.esi-sba.dz/jspui/handle/123456789/1001
Title: Optimal Transport-Regularised Knowledge Distillation and Synthetic Data Generation for Student–Teacher Model Compression
Authors: OMRANI, RAbah
Keywords: Optimal Transport
knowledge Dstillation
Model Compression
Student–Teacher Framework
Synthetic Data Generation
Information Geometry
Issue Date: 2026
Abstract: The deployment of large neural networks on resource-constrained hardware has made knowledge distillation, the transfer of knowledge from a large teacher model to a compact student model, a central practical concern. Classical distillation methods remain fragile under two conditions that have become routine in modern practice: large capacity gaps between teacher and student, and architectural heterogeneity that prevents direct feature correspondence. This thesis addresses both shortcomings by reformulating distillation as a problem in the geometry of probability distributions. The central methodological contribution is a unified training objective combining cross-entropy, temperature-scaled response distillation, and an entropic optimal-transport loss acting on the empirical distributions of intermediate features; dimensional mismatch is resolved by learnable linear projections, and structural mismatch by an unbalanced transport extension. A complementary data-free pipeline synthesises training data directly from the teacher’s parameters, preserving the distributional and topological structure of its implicit data manifold through persistent homology. On the theoretical side, we derive a Lipschitz bound relating the Wasserstein feature distance to the Fisher-Rao output distance, together with a generalisation bound on the student’s risk. Empirically, optimal-transport-regularised distillation improves over vanilla knowledge distillation with high statistical significance, with the largest gains on cross-architecture and extreme-compression scenarios, and the data-free pipeline recovers over ninety percent of real-data distillation performance on standard benchmarks.*** Le déploiement de réseaux de neurones volumineux sur du matériel à ressources limitées a fait de la distillation des connaissances, le transfert de connaissances d’un modèle enseignant volumineux vers un modèle étudiant compact, une préoccupation pratique centrale. Les méthodes classiques restent toutefois fragiles dans deux situations devenues courantes : un écart de capacité important entre l’enseignant et l’étudiant, et une hétérogénéité architecturale qui empêche toute correspondance directe des caractéristiques. Cette thèse aborde ces deux limites en reformulant la distillation comme un problème de géométrie des distributions de probabilité. La contribution méthodologique principale est un objectif d’entraînement unifié combinant l’entropie croisée, la distillation des sorties mise à l’échelle par la température et une perte de transport optimal entropique appliquée aux distributions empiriques des caractéristiques intermédiaires ; les différences de dimension sont résolues par des projections linéaires apprises, et l’hétérogénéité structurelle par une extension de transport déséquilibré. Un pipeline complémentaire, sans données, synthétise les données d’entraînement directement à partir des paramètres de l’enseignant, en préservant la structure géométrique et topologique de sa variété de données implicite grâce à l’homologie persistante. Sur le plan théorique, nous établissons une borne de Lipschitz reliant la distance de Wasserstein des caractéristiques à la distance de Fisher-Rao des sorties, ainsi qu’une borne de généralisation sur le risque de l’étudiant. Empiriquement, la distillation régularisée par transport optimal surpasse la distillation classique avec une forte significativité statistique, les gains les plus importants étant observés dans les scénarios inter-architectures et de compression extrême, et le pipeline sans données récupère plus de quatre-vingt-dix pour cent des performances obtenues avec les données réelles.
Description: Supervisor : Dr. Nassima Dif/Co-supervisor : Pr. Cédric Wemmert /Co-supervisor: Dr. Ali Ayadi
URI: https://repository.esi-sba.dz/jspui/handle/123456789/1001
Appears in Collections:Master

Files in This Item:
File Description SizeFormat 
Master_OMRANI_Rabah-1-1.pdf92,57 kBAdobe PDFView/Open
Show full item record


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.