Skip navigation
Please use this identifier to cite or link to this item: https://repository.esi-sba.dz/jspui/handle/123456789/1011
Full metadata record
DC FieldValueLanguage
dc.contributor.authorDALLAA, ABdelsamad TAki-EDdine-
dc.date.accessioned2026-10-08T10:07:58Z-
dc.date.available2026-10-08T10:07:58Z-
dc.date.issued2026-
dc.identifier.urihttps://repository.esi-sba.dz/jspui/handle/123456789/1011-
dc.descriptionSupervisor :Mr. Souleyman Chaib / Supervisor : Mr. Zeyd Boukhers / Supervisor : Mr. Lingxiao Kongen_US
dc.description.abstractMulti-objective alignment of Large Language Models (LLMs) is the problem of training a single model to faithfully serve diverse, potentially conflicting user objectives, such as helpfulness, safety, verbosity, and correctness without committing to a fixed behavioural trade-off at training time. This report surveys the theoretical foundations and principal methods in this field, covering the post-training pipeline, preference optimisation objectives, parameter-efficient fine-tuning techniques, hypernetworks, and multi-objective optimisation theory. Three alignment approaches are analysed in depth: Rewards-in-Context (RiC), Rewarded Soups, and Panacea, alongside related methods including SteerLM, ArmoRM, and recent hypernetwork-based personalisation systems. A comparative analysis is conducted across dimensions of preference representation, training cost, inference flexibility, Pareto-front coverage, and prompt-awareness. The survey concludes by identifying prompt-agnosticism as a shared limitation of current weight-space methods, and positions context-conditioned hypernetwork adapters as a promising direction for future work. *** L’alignement multi-objectif des modèles LLM est le problème de la formation d’un modèle unique pour servir fidèlement des objectifs d’utilisateur divers et potentiellement conflictuels, tels que l’utilité, la sécurité, la verbosité et l’exactitude, sans s’engager dans un compromis comportemental fixe au moment de la formation. Ce rapport examine les fondements théoriques et les principales méthodes dans ce domaine, couvrant le post-entraînement, les objectifs d’optimisation des préférences, les techniques de Parameter-Efficient Fine-Tuning (PEFT), les hyperréseaux et la théorie de l’optimisation multi-objectifs. Trois approches d’alignement sont analysées en profondeur : Rewardsin- Context (RiC), Rewarded Soups et Panacea, ainsi que des méthodes connexes, notamment SteerLM, ArmoRM et les récents systèmes de personnalisation basés sur les hyperréseaux. Une analyse comparative est menée sur les dimensions de la représentation des préférences, du coût de la formation, de la flexibilité de l’inférence, de la couverture Pareto-front et de la prise de conscience des invites. L’enquête se termine en identifiant l’agnosticisme rapide comme une limitation commune des méthodes actuelles d’espace de poids et positionne les adaptateurs d’hyperréseau conditionnés par le contexte comme une direction prometteuse pour les travaux futurs.en_US
dc.language.isoenen_US
dc.subjectLarge Language Modelsen_US
dc.subjectMulti-Objective Alignmenten_US
dc.subjectHypernetworksen_US
dc.subjectParameter-Efficient Fine-Tuningen_US
dc.subjectPareto Optimalityen_US
dc.subjectPreference Vectorsen_US
dc.subjectSingular Value Decompositionen_US
dc.titleMulti-Objective Alignment of Large Language Models with Preference Vectors: A Survey of Methods and Approachesen_US
dc.typeThesisen_US
Appears in Collections:Master

Files in This Item:
File Description SizeFormat 
AbdessamedDallaa_Master-1-1.pdf90,1 kBAdobe PDFView/Open
Show simple item record


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.