| DC Field | Value | Language |
| dc.contributor.author | BAIDAR, SAmir | - |
| dc.date.accessioned | 2026-10-07T07:50:11Z | - |
| dc.date.available | 2026-10-07T07:50:11Z | - |
| dc.date.issued | 2026 | - |
| dc.identifier.uri | https://repository.esi-sba.dz/jspui/handle/123456789/983 | - |
| dc.description | Supervisor: Dr. MAHAMMED Nadir /
Co-supervisor: Dr. ACED Mohamed Reda | en_US |
| dc.description.abstract | Mental health prevention and support professionals must routinely recognise and respond to
discourse expressing psychological distress, yet training resources built on authentic crisis
narratives raise serious privacy concerns and are difficult to produce at scale. This thesis
investigates whether open-source, offline-deployable language models can be fine-tuned to
generate synthetic texts that realistically simulate psychological distress at controlled severity
levels, offering a privacy-preserving alternative for professional training, detection-system
evaluation, and awareness-raising.
To this end, a binary-labelled social media corpus of suicidality-related posts is reformulated
into a four-tier severity resource through a dedicated annotation pipeline that combines
semantic embedding similarity, clinical keyword scoring, and post length into a single composite
score, calibrated against an independently annotated clinical reference corpus and
refined with targeted overrides for unambiguous crisis language. Five open-source decoderonly
models, spanning three model families and a range of parameter scales, are then finetuned
under a shared low-rank adaptation regime to generate text conditioned on discrete
severity tokens aligned with PHQ-9 criteria, and subsequently quantized and packaged for
fully offline deployment.
Comparative evaluation across the five fine-tuned models reveals that base model architecture
and tokenizer design influence generation quality at least as strongly as raw parameter
count, with the most efficient model of the set outperforming a substantially larger counterpart.
Post-quantization analysis further shows that offline packaging preserves the fine-tuned
models’ behaviour closely enough that deployment introduces no meaningful loss in generation
quality or control integrity, supporting the practical viability of a fully local pipeline.
The five models are deployed through Spectrum, a browser-based generation console that exposes
severity-conditioned inference with full prompt transparency, audit logging, and batch
export in a self-contained local environment.
Taken together, these results establish a replicable methodology for severity-controlled
distress text generation using exclusively open-source tools, and contribute the annotation
pipeline, trained model artifacts, and associated ethical safeguards to the mental health NLP
research community. Quantitative validation of severity control through an independent
classifier-judge, together with an expert clinical review of generation quality, is planned as a
subsequent stage of this work.***
Les professionnels de la prévention et de l’accompagnement en santé mentale doivent régulièrement
reconnaître et répondre à des discours de détresse psychologique, mais les formations
basées sur des récits de crise authentiques posent de sérieux problèmes de confidentialité
et sont difficiles à produire à grande échelle. Ce mémoire examine si des modèles
de langage opensource, déployables hors ligne, peuvent être affinés pour générer des textes
synthétiques simulant de manière réaliste la détresse psychologique à des niveaux de sévérité
contrôlés, offrant une alternative respectueuse de la confidentialité pour la formation,
lévaluation de systèmes de détection et la sensibilisation.
À cette fin, un corpus de publications issues des réseaux sociaux, initialement annoté de
manière binaire, est reformulé en une ressource à quatre niveaux de sévérité grâce à un pipeline
dannotation combinant similarité dembeddings sémantiques, score de motsclés cliniques
et longueur des textes en un score composite, calibré sur un corpus clinique de référence et
affiné par des seuils ciblant le langage de crise non ambigu. Cinq modèles décodeurs opensource
issus de trois familles et de tailles variées sont ensuite affinés via un même protocole
LoRA pour générer du texte conditionné par des jetons de sévérité alignés sur les critères
PHQ9, puis quantifiés et packagés pour un déploiement hors ligne.
Lévaluation comparative révèle que larchitecture et la tokenisation influencent la qualité
de génération autant que le nombre de paramètres, le modèle le plus efficace surpassant un
homologue bien plus volumineux. Lanalyse postquantification montre que le packaging hors
ligne préserve le comportement sans perte significative de qualité de génération ni dintégrité
du contrôle de sévérité, confirmant la viabilité dun pipeline entièrement local. Les cinq modèles
sont déployés à travers Spectrum, une console de génération en navigateur qui expose
linférence conditionnée par la sévérité avec transparence complète des prompts, journalisation
daudit et export par lots, dans un environnement local autonome.
Ces résultats établissent une méthodologie reproductible pour la génération de textes
de détresse contrôlés en sévérité, sappuyant exclusivement sur des outils opensource, et apportent
à la communauté TALsanté mentale le pipeline dannotation, les modèles entraînés et
les gardefous éthiques associés. Une validation quantitative par un classifieur indépendant et
une revue clinique experte sont prévues comme étape ultérieure. | en_US |
| dc.language.iso | en | en_US |
| dc.subject | Psychological Distress Simulation | en_US |
| dc.subject | Severity-Conditioned Text Generation | en_US |
| dc.subject | Large language models | en_US |
| dc.subject | LoRA fine-Tuning | en_US |
| dc.subject | Mental Health NLP | en_US |
| dc.subject | GGUF Quantization | en_US |
| dc.title | Generation of Texts Simulating Psychological Distress Using Generative Language Models | en_US |
| dc.type | Thesis | en_US |
| Appears in Collections: | Ingenieur
|