Skip navigation
Please use this identifier to cite or link to this item: https://repository.esi-sba.dz/jspui/handle/123456789/983
Title: Generation of Texts Simulating Psychological Distress Using Generative Language Models
Authors: BAIDAR, SAmir
Keywords: Psychological Distress Simulation
Severity-Conditioned Text Generation
Large language models
LoRA fine-Tuning
Mental Health NLP
GGUF Quantization
Issue Date: 2026
Abstract: Mental health prevention and support professionals must routinely recognise and respond to discourse expressing psychological distress, yet training resources built on authentic crisis narratives raise serious privacy concerns and are difficult to produce at scale. This thesis investigates whether open-source, offline-deployable language models can be fine-tuned to generate synthetic texts that realistically simulate psychological distress at controlled severity levels, offering a privacy-preserving alternative for professional training, detection-system evaluation, and awareness-raising. To this end, a binary-labelled social media corpus of suicidality-related posts is reformulated into a four-tier severity resource through a dedicated annotation pipeline that combines semantic embedding similarity, clinical keyword scoring, and post length into a single composite score, calibrated against an independently annotated clinical reference corpus and refined with targeted overrides for unambiguous crisis language. Five open-source decoderonly models, spanning three model families and a range of parameter scales, are then finetuned under a shared low-rank adaptation regime to generate text conditioned on discrete severity tokens aligned with PHQ-9 criteria, and subsequently quantized and packaged for fully offline deployment. Comparative evaluation across the five fine-tuned models reveals that base model architecture and tokenizer design influence generation quality at least as strongly as raw parameter count, with the most efficient model of the set outperforming a substantially larger counterpart. Post-quantization analysis further shows that offline packaging preserves the fine-tuned models’ behaviour closely enough that deployment introduces no meaningful loss in generation quality or control integrity, supporting the practical viability of a fully local pipeline. The five models are deployed through Spectrum, a browser-based generation console that exposes severity-conditioned inference with full prompt transparency, audit logging, and batch export in a self-contained local environment. Taken together, these results establish a replicable methodology for severity-controlled distress text generation using exclusively open-source tools, and contribute the annotation pipeline, trained model artifacts, and associated ethical safeguards to the mental health NLP research community. Quantitative validation of severity control through an independent classifier-judge, together with an expert clinical review of generation quality, is planned as a subsequent stage of this work.*** Les professionnels de la prévention et de l’accompagnement en santé mentale doivent régulièrement reconnaître et répondre à des discours de détresse psychologique, mais les formations basées sur des récits de crise authentiques posent de sérieux problèmes de confidentialité et sont difficiles à produire à grande échelle. Ce mémoire examine si des modèles de langage opensource, déployables hors ligne, peuvent être affinés pour générer des textes synthétiques simulant de manière réaliste la détresse psychologique à des niveaux de sévérité contrôlés, offrant une alternative respectueuse de la confidentialité pour la formation, lévaluation de systèmes de détection et la sensibilisation. À cette fin, un corpus de publications issues des réseaux sociaux, initialement annoté de manière binaire, est reformulé en une ressource à quatre niveaux de sévérité grâce à un pipeline dannotation combinant similarité dembeddings sémantiques, score de motsclés cliniques et longueur des textes en un score composite, calibré sur un corpus clinique de référence et affiné par des seuils ciblant le langage de crise non ambigu. Cinq modèles décodeurs opensource issus de trois familles et de tailles variées sont ensuite affinés via un même protocole LoRA pour générer du texte conditionné par des jetons de sévérité alignés sur les critères PHQ9, puis quantifiés et packagés pour un déploiement hors ligne. Lévaluation comparative révèle que larchitecture et la tokenisation influencent la qualité de génération autant que le nombre de paramètres, le modèle le plus efficace surpassant un homologue bien plus volumineux. Lanalyse postquantification montre que le packaging hors ligne préserve le comportement sans perte significative de qualité de génération ni dintégrité du contrôle de sévérité, confirmant la viabilité dun pipeline entièrement local. Les cinq modèles sont déployés à travers Spectrum, une console de génération en navigateur qui expose linférence conditionnée par la sévérité avec transparence complète des prompts, journalisation daudit et export par lots, dans un environnement local autonome. Ces résultats établissent une méthodologie reproductible pour la génération de textes de détresse contrôlés en sévérité, sappuyant exclusivement sur des outils opensource, et apportent à la communauté TALsanté mentale le pipeline dannotation, les modèles entraînés et les gardefous éthiques associés. Une validation quantitative par un classifieur indépendant et une revue clinique experte sont prévues comme étape ultérieure.
Description: Supervisor: Dr. MAHAMMED Nadir / Co-supervisor: Dr. ACED Mohamed Reda
URI: https://repository.esi-sba.dz/jspui/handle/123456789/983
Appears in Collections:Ingenieur

Files in This Item:
File Description SizeFormat 
memoire_ingénieur-1-1.pdf84,07 kBAdobe PDFView/Open
Show full item record


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.