https://repository.esi-sba.dz/jspui/handle/123456789/976| Title: | Design of a Hybrid Clinical Pre-Analysis Module for Rare Disease Diagnostic Support |
| Authors: | OURRED, ISlem CHaraf EDdine OUDDANE, YOucef FAhed |
| Keywords: | Natural Language Processing Rare Diseases Named Entity Recognition HPO ORDO UMLS Phenopackets ClinicalBERT SapBERT Clinical Pre-analysis Hybrid Systems |
| Issue Date: | 2026 |
| Abstract: | Rare diseases affect over 400 million people worldwide and are characterized by a prolonged diagnostic journey that averages 4.7 years. Clinical data in Electronic Medical Records is predominantly unstructured, making it difficult for healthcare professionals to efficiently extract and organize the relevant information needed for diagnosis. This thesis proposes the design of a hybrid clinical pre-analysis module that combines the contextual understanding of pre-trained biomedical language models with the precision of rule-based systems and standardized medical ontologies. The system implements a complete pipeline that processes raw clinical text through five stages: preprocessing with language detection and de-identification, bilingual Named Entity Recognition using an ensemble of specialized models, clinical validation with negation detection, multi-level normalization against HPO, ORDO, and UMLS ontologies, and structured output generation following the Phenopackets standard (ISO 4454). The system was evaluated on 112 clinical cases across five datasets, including 17 real hospital reports from the Hôpital pédiatrique de Canastel (Children’s Hospital) of Oran. On these French clinical reports, the system achieved an F1 score of 60.0% for phenotype extraction, 88.2% accuracy for disease identification, and 100% successful Phenopacket generation*** Les maladies rares touchent plus de 400 millions de personnes dans le monde et se caractérisent par un parcours diagnostique prolongé dont la durée moyenne est de 4,7 ans. Les données cliniques contenues dans les dossiers médicaux électroniques sont majoritairement non structurées, ce qui rend difficile pour les professionnels de santé l’extraction et l’organisation efficaces des informations pertinentes nécessaires au diagnostic. Ce mémoire propose la conception d’un module de pré-analyse clinique hybride combinant la compréhension contextuelle de modèles de langage biomédicaux pré-entraînés avec la précision de systèmes à base de règles et d’ontologies médicales standardisées. Le système implémente un pipeline complet qui traite le texte clinique brut à travers cinq étapes : le prétraitement avec détection de langue et dé-identification, la reconnaissance d’entités nommées bilingue utilisant un ensemble de modèles spécialisés, la validation clinique avec détection de négation, la normalisation multi-niveaux selon les ontologies HPO, ORDO et UMLS, et la génération de sortie structurée suivant le standard Phenopackets (ISO 4454). Le système a été évalué sur 112 cas cliniques répartis sur cinq jeux de données, incluant 17 rapports hospitaliers réels de l’Hôpital pédiatrique de Canastel d’Oran. Sur ces rapports cliniques français, le système atteint un score F1 de 60,0% pour l’extraction de phénotypes, une précision de 88,2% pour l’identification des maladies, et un taux de 100% pour la génération de Phenopackets. |
| Description: | Encadreur : Dr. Mezrar Samiha / Co-Encadreur : Pr. Keskes Nabil / Co-Encadreur : Dr. Kornyshova Elena / Co-Encadreur: Dr. Pons Olivier |
| URI: | https://repository.esi-sba.dz/jspui/handle/123456789/976 |
| Appears in Collections: | Ingenieur |
| File | Description | Size | Format | |
|---|---|---|---|---|
| memoire_pfe-1-1.pdf | 139,32 kB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.