| DC Field | Value | Language |
| dc.contributor.author | LARBI, MOhammed AChraf | - |
| dc.date.accessioned | 2026-10-06T14:35:46Z | - |
| dc.date.available | 2026-10-06T14:35:46Z | - |
| dc.date.issued | 2026 | - |
| dc.identifier.uri | https://repository.esi-sba.dz/jspui/handle/123456789/978 | - |
| dc.description | Encadreur : Mme MEZRAR Samiha /
Encadreur : • Mme KLOUCHE Badia /
Encadreur• Mme Elena Kornyshova /
Encadreur• M Olivier Pons | en_US |
| dc.description.abstract | Large Language Models (LLMs) are increasingly applied to clinical decision support, yet their
tendency to generate fluent but factually incorrect outputs, termed hallucinations, poses a
significant barrier to adoption in safety-critical medical domains. This risk is especially
acute for rare diseases, where limited training data and overlapping phenotypes amplify the
likelihood of fabricated diagnoses.
This end-of-studies project investigates a hybrid hallucination mitigation approach that
combines Retrieval-Augmented Generation (RAG) with structured Prompt Engineering (PE)
and knowledge graph enrichment for rare disease diagnosis. A five-source biomedical knowledge
corpus (130,316 documents from PubMed, GARD, UMLS, RDS, and PubMed abstracts)
was constructed with dual embedding profiles and a three-stage hybrid retrieval
pipeline (dense, lexical, and cross-encoder reranking). Twelve distinct diagnostic configurations,
spanning prompt-only baselines, RAG variants, graph-augmented architectures, and
hybrid CoT-RAG pipelines, were systematically evaluated across two open-source biomedical
LLMs (BioMistral-7B and OpenBioLLM-8B) on 200 RareBench cases. A novel Hallucination
Gravity Index (HGI) was introduced for severity-weighted assessment.
The best configuration, BioMistral-7B with RAG-Driven Chain-of-Thought, achieved
59.0% exact-match accuracy on a 200-case subset with a full hybrid retrieval pipeline. For
reference, Chen et al. [1] report 40.0% for GPT-4 on the full RareBench benchmark without
retrieval augmentation; however, a direct comparison is not possible as the two evaluations
differ in subset size, matching criteria, and retrieval setup. An ISO 4454 phenopacket ablation,
conducted in collaboration with a parallel research theme using real hospitalisation
records, demonstrated that clinician-curated phenotypic inputs reduce hallucination severity
by 38% in retrieve-first architectures compared to LLM-extracted phenotypes***
Les grands modèles de langage (LLM) sont de plus en plus appliqués à l’aide à la décision
clinique, mais leur tendance à générer des sorties fluides mais factuellement incorrectes,
appelées hallucinations, constitue un obstacle majeur à leur adoption dans les domaines
médicaux critiques. Ce risque est particulièrement aigu pour les maladies rares, où la rareté
des données d’entraînement et le chevauchement phénotypique amplifient la probabilité de
diagnostics fabriqués.
Ce projet de fin d’études étudie une approche hybride d’atténuation des hallucinations
combinant la Génération Augmentée par la Recherche (RAG) avec l’ingénierie des prompts
structurée et l’enrichissement par graphe de connaissances pour le diagnostic des maladies
rares. Un corpus biomédical de 130 316 documents provenant de cinq sources (PubMed,
GARD, UMLS, RDS et résumés PubMed) a été construit avec des profils d’embedding
doubles et un pipeline de recherche hybride à trois étapes. Douze configurations diagnostiques
distinctes ont été évaluées systématiquement sur deux LLM biomédicaux open-source
(BioMistral-7B et OpenBioLLM-8B) sur 200 cas RareBench. Un nouvel indice de gravité
des hallucinations (HGI) a été introduit pour une évaluation pondérée par la sévérité.
La meilleure configuration, BioMistral-7B avec RAG-Driven Chain-of-Thought, a atteint
une précision d’exact-match de 59,0% sur un sous-ensemble de 200 cas avec un pipeline
de retrieval hybride complet. À titre de référence, Chen et al. [1] rapportent 40,0% pour
GPT-4 sur le benchmark RareBench complet sans augmentation par retrieval ; toutefois, une
comparaison directe n’est pas possible car les deux évaluations diffèrent en taille de sousensemble,
critères de correspondance et configuration de retrieval. Une étude d’ablation
par phénopackets ISO 4454, réalisée en collaboration avec un thème de recherche parallèle
utilisant des dossiers d’hospitalisation réels, a démontré que les entrées phénotypiques
curées par des cliniciens réduisent la sévérité des hallucinations de 38% dans les architectures
retrieve-first par rapport aux phénotypes extraits par le LLM. | en_US |
| dc.language.iso | en | en_US |
| dc.subject | Large Language Models (LLMs | en_US |
| dc.subject | Hallucination Mitigation | en_US |
| dc.subject | Retrieval-Augmented Generation (RAG) | en_US |
| dc.subject | Prompt Engineering | en_US |
| dc.subject | Rare Diseases | en_US |
| dc.subject | Knowledge Graphs | en_US |
| dc.subject | Hallucination Gravity Index (HGI | en_US |
| dc.subject | ISO 4454 Phenopackets | en_US |
| dc.title | Mitigating Hallucinations in Large Language Models: A RAG and Prompt Engineering Approach Applied to Rare Diseases | en_US |
| dc.type | Thesis | en_US |
| Appears in Collections: | Ingenieur
|