Skip navigation
Please use this identifier to cite or link to this item: https://repository.esi-sba.dz/jspui/handle/123456789/976
Full metadata record
DC FieldValueLanguage
dc.contributor.authorOURRED, ISlem CHaraf EDdine-
dc.contributor.authorOUDDANE, YOucef FAhed-
dc.date.accessioned2026-10-06T13:23:55Z-
dc.date.available2026-10-06T13:23:55Z-
dc.date.issued2026-
dc.identifier.urihttps://repository.esi-sba.dz/jspui/handle/123456789/976-
dc.descriptionEncadreur : Dr. Mezrar Samiha / Co-Encadreur : Pr. Keskes Nabil / Co-Encadreur : Dr. Kornyshova Elena / Co-Encadreur: Dr. Pons Olivieren_US
dc.description.abstractRare diseases affect over 400 million people worldwide and are characterized by a prolonged diagnostic journey that averages 4.7 years. Clinical data in Electronic Medical Records is predominantly unstructured, making it difficult for healthcare professionals to efficiently extract and organize the relevant information needed for diagnosis. This thesis proposes the design of a hybrid clinical pre-analysis module that combines the contextual understanding of pre-trained biomedical language models with the precision of rule-based systems and standardized medical ontologies. The system implements a complete pipeline that processes raw clinical text through five stages: preprocessing with language detection and de-identification, bilingual Named Entity Recognition using an ensemble of specialized models, clinical validation with negation detection, multi-level normalization against HPO, ORDO, and UMLS ontologies, and structured output generation following the Phenopackets standard (ISO 4454). The system was evaluated on 112 clinical cases across five datasets, including 17 real hospital reports from the Hôpital pédiatrique de Canastel (Children’s Hospital) of Oran. On these French clinical reports, the system achieved an F1 score of 60.0% for phenotype extraction, 88.2% accuracy for disease identification, and 100% successful Phenopacket generation*** Les maladies rares touchent plus de 400 millions de personnes dans le monde et se caractérisent par un parcours diagnostique prolongé dont la durée moyenne est de 4,7 ans. Les données cliniques contenues dans les dossiers médicaux électroniques sont majoritairement non structurées, ce qui rend difficile pour les professionnels de santé l’extraction et l’organisation efficaces des informations pertinentes nécessaires au diagnostic. Ce mémoire propose la conception d’un module de pré-analyse clinique hybride combinant la compréhension contextuelle de modèles de langage biomédicaux pré-entraînés avec la précision de systèmes à base de règles et d’ontologies médicales standardisées. Le système implémente un pipeline complet qui traite le texte clinique brut à travers cinq étapes : le prétraitement avec détection de langue et dé-identification, la reconnaissance d’entités nommées bilingue utilisant un ensemble de modèles spécialisés, la validation clinique avec détection de négation, la normalisation multi-niveaux selon les ontologies HPO, ORDO et UMLS, et la génération de sortie structurée suivant le standard Phenopackets (ISO 4454). Le système a été évalué sur 112 cas cliniques répartis sur cinq jeux de données, incluant 17 rapports hospitaliers réels de l’Hôpital pédiatrique de Canastel d’Oran. Sur ces rapports cliniques français, le système atteint un score F1 de 60,0% pour l’extraction de phénotypes, une précision de 88,2% pour l’identification des maladies, et un taux de 100% pour la génération de Phenopackets.en_US
dc.language.isoenen_US
dc.subjectNatural Language Processingen_US
dc.subjectRare Diseasesen_US
dc.subjectNamed Entity Recognitionen_US
dc.subjectHPOen_US
dc.subjectORDOen_US
dc.subjectUMLSen_US
dc.subjectPhenopacketsen_US
dc.subjectClinicalBERTen_US
dc.subjectSapBERTen_US
dc.subjectClinical Pre-analysisen_US
dc.subjectHybrid Systemsen_US
dc.titleDesign of a Hybrid Clinical Pre-Analysis Module for Rare Disease Diagnostic Supporten_US
dc.typeThesisen_US
Appears in Collections:Ingenieur

Files in This Item:
File Description SizeFormat 
memoire_pfe-1-1.pdf139,32 kBAdobe PDFView/Open
Show simple item record


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.