Skip navigation
Please use this identifier to cite or link to this item: https://repository.esi-sba.dz/jspui/handle/123456789/976
Title: Design of a Hybrid Clinical Pre-Analysis Module for Rare Disease Diagnostic Support
Authors: OURRED, ISlem CHaraf EDdine
OUDDANE, YOucef FAhed
Keywords: Natural Language Processing
Rare Diseases
Named Entity Recognition
HPO
ORDO
UMLS
Phenopackets
ClinicalBERT
SapBERT
Clinical Pre-analysis
Hybrid Systems
Issue Date: 2026
Abstract: Rare diseases affect over 400 million people worldwide and are characterized by a prolonged diagnostic journey that averages 4.7 years. Clinical data in Electronic Medical Records is predominantly unstructured, making it difficult for healthcare professionals to efficiently extract and organize the relevant information needed for diagnosis. This thesis proposes the design of a hybrid clinical pre-analysis module that combines the contextual understanding of pre-trained biomedical language models with the precision of rule-based systems and standardized medical ontologies. The system implements a complete pipeline that processes raw clinical text through five stages: preprocessing with language detection and de-identification, bilingual Named Entity Recognition using an ensemble of specialized models, clinical validation with negation detection, multi-level normalization against HPO, ORDO, and UMLS ontologies, and structured output generation following the Phenopackets standard (ISO 4454). The system was evaluated on 112 clinical cases across five datasets, including 17 real hospital reports from the Hôpital pédiatrique de Canastel (Children’s Hospital) of Oran. On these French clinical reports, the system achieved an F1 score of 60.0% for phenotype extraction, 88.2% accuracy for disease identification, and 100% successful Phenopacket generation*** Les maladies rares touchent plus de 400 millions de personnes dans le monde et se caractérisent par un parcours diagnostique prolongé dont la durée moyenne est de 4,7 ans. Les données cliniques contenues dans les dossiers médicaux électroniques sont majoritairement non structurées, ce qui rend difficile pour les professionnels de santé l’extraction et l’organisation efficaces des informations pertinentes nécessaires au diagnostic. Ce mémoire propose la conception d’un module de pré-analyse clinique hybride combinant la compréhension contextuelle de modèles de langage biomédicaux pré-entraînés avec la précision de systèmes à base de règles et d’ontologies médicales standardisées. Le système implémente un pipeline complet qui traite le texte clinique brut à travers cinq étapes : le prétraitement avec détection de langue et dé-identification, la reconnaissance d’entités nommées bilingue utilisant un ensemble de modèles spécialisés, la validation clinique avec détection de négation, la normalisation multi-niveaux selon les ontologies HPO, ORDO et UMLS, et la génération de sortie structurée suivant le standard Phenopackets (ISO 4454). Le système a été évalué sur 112 cas cliniques répartis sur cinq jeux de données, incluant 17 rapports hospitaliers réels de l’Hôpital pédiatrique de Canastel d’Oran. Sur ces rapports cliniques français, le système atteint un score F1 de 60,0% pour l’extraction de phénotypes, une précision de 88,2% pour l’identification des maladies, et un taux de 100% pour la génération de Phenopackets.
Description: Encadreur : Dr. Mezrar Samiha / Co-Encadreur : Pr. Keskes Nabil / Co-Encadreur : Dr. Kornyshova Elena / Co-Encadreur: Dr. Pons Olivier
URI: https://repository.esi-sba.dz/jspui/handle/123456789/976
Appears in Collections:Ingenieur

Files in This Item:
File Description SizeFormat 
memoire_pfe-1-1.pdf139,32 kBAdobe PDFView/Open
Show full item record


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.