Skip navigation
Please use this identifier to cite or link to this item: https://repository.esi-sba.dz/jspui/handle/123456789/965
Title: Aligning Large Language Models at Inference-Time with Preference Vectors using Hypernetworks
Authors: DALLAA, ABdelsamad TAki-EDdine
Keywords: Large Language Models
Multi-Objective Alignment
Hypernetworks
Parameter Efficient Fine-Tuning
Pareto Optimality
Preference Vectors
Singular Value Decomposition
SimPO
IRPO
Issue Date: 2026
Abstract: Modern Large Language Model (LLM)s deployed in real-world settings must simultaneously satisfy multiple, often conflicting, user objectives, such as helpfulness, safety, verbosity, and correctness. Standard fine-tuning collapses these trade-offs into a single fixed behaviour, leaving users without recourse when their needs deviate from the model’s learned prior. Multi-objective alignment methods address this by producing a family of behaviours parameterised by a preference vector on the probability simplex, so that inference-time steering becomes possible. Existing preference-conditioned adapters inject the preference vector into the singularvalue scaling factors of a frozen Singular Value Decomposition (SVD)-based Low-Rank Adaptation (LoRA) adapter. This formulation assumes that the optimal trade-off for a given preference vector is context-independent, an assumption that breaks down in practice. A coding query and a medical query may require very different weightings of helpfulness versus safety even under an identical preference vector. This thesis proposes a lightweight hypernetwork that conditions the singular-value adapter on both the preference vector and the input prompt x, using Feature-wise Linear Modulation (FiLM) to fuse the two sources of context. The hypernetwork generates per-layer, per-matrix singular-value vectors in approximately 630 K trainable parameters, leaving the base model fully frozen. Training uses reference-free Simple Preference Optimisation (SimPO) with an IRPO-inspired NLL regularization term, Dirichlet-sampled preferences, and Tchebycheff scalarisation for winner determination, enabling dense coverage of the preference simplex while saving memory by not having to load a reference model or Supervised Fine-Tuning (SFT) warm-start. All methods discussed in this thesis are evaluated on the HelpSteer2 dataset using Qwen2.5-0.5B-Instruct as the backbone, with hypervolume and linear utility as primary metrics*** Les modèles LLM déployés en situation réelle doivent satisfaire simultanément de multiples objectifs utilisateurs, souvent contradictoires, tels que l’utilité, la sécurité, la concision et l’exactitude. Le fine-tuning supervisé standard (SFT) réduit ces compromis à un comportement fixe unique, privant ainsi les utilisateurs de toute possibilité de modification lorsque leurs besoins s’écartent des connaissances a priori acquises par le modèle. Les méthodes d’alignement multi-objectifs remédient à ce problème en générant une famille de comportements paramétrés par un vecteur de préférence p sur le simplexe de probabilité, permettant ainsi un pilotage lors de l’inférence. Les adaptateurs conditionnés par les préférences existants injectent p dans les facteurs d’échelle des valeurs singulières d’un adaptateur LoRA basé sur la décomposition en valeurs singulières (SVD) figé. Cette formulation suppose que le compromis optimal pour un vecteur de préférence donné est indépendant du contexte, une hypothèse qui se révèle erronée en pratique. Une requête de code et une requête médicale peuvent nécessiter des pondérations très différentes entre l’utilité et la sécurité, même avec un vecteur de préférences identique. Cette thèse propose un hyperréseau léger qui conditionne l’adaptateur de valeurs singulières à la fois au vecteur de préférences et à la requête d’entrée x, en utilisant la modulation FiLM pour fusionner les deux sources de contexte. L’hyperréseau génère des vecteurs de valeurs singulières par couche et par matrice, avec environ 630 000 paramètres entraînables, le modèle de base restant entièrement figé. L’entraînement utilise l’optimisation simple des préférences (SimPO) sans modèle de référence, avec des préférences échantillonnées à partir d’une distribution Dirichlet et une scalarisation de Tchebycheff pour la détermination de la meilleure réponse, permettant une couverture dense du simplexe de préférences sans modèle de référence ni initialisation par fine-tuning supervisé (SFT). Toutes les méthodes discutées sont évaluées sur le jeu de données HelpSteer2 en utilisant Qwen2.5-0.5B-Instruct comme architecture de base, avec l’hypervolume et l’utilité linéaire comme métriques principales.
Description: Supervisor :Mr. Souleyman Chaib / Supervisor :Mr. Zeyd Boukhers/ Supervisor :Mr. Lingxiao Kong
URI: https://repository.esi-sba.dz/jspui/handle/123456789/965
Appears in Collections:Ingenieur

Files in This Item:
File Description SizeFormat 
AbdessamedDallaa_Engineer-1-1.pdf100,87 kBAdobe PDFView/Open
Show full item record


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.