| Abstract: | Large Language Models (LLMs) have reached remarkable performance across an impressive
breadth of natural-language tasks, yet they remain vulnerable to hallucinations Ů answers
that are plausible at Ąrst sight but ultimately false or fabricated. This thesis offers an endto-
end study of hallucination detection that relies on only one model response, sidestepping
the heavy compute and storage demands of multi-response consistency checks or large-scale
retrieval. We introduce lightweight detectors that operate in (i) white-box and (ii) blackbox
regimes by analyzing internal activations, attention patterns, and token-level conĄdences
from an auxiliary LLM. When ground-truth references exist, as in Retrieval-Augmented Generation
(RAG), our framework integrates external evidence to boost reliability. Experiments
on multiple open benchmarks show speed-ups of up to 45× (white-box) and 450× (black-box)
over prevailing baselines, while achieving substantial gains in AUC and F1. These results
demonstrate that real-time, high-precision hallucination detection is attainable without sacriĄcing
computational efficiency.****
Les grands modèles de langage (LLMs) atteignent des performances remaraquables sur une
vaste gamme de tâches, mais demeurent sujets aux hallucinations : des réponses apparemment
plausibles qui se révèlent pourtant fausses ou inventées. Ce mémoire présente une étude
de bout en bout de la détection dŠhallucinations reposant sur une seule réponse du modèle,
évitant ainsi les coûts élevés en calcul et en mémoire des vériĄcations de cohérence multiréponses
ou des méthodes de recherche à grande échelle. Nous proposons des détecteurs légers
fonctionnant en (i) mode ń boîte blanche ż et (ii) mode ń boîte noire ż, en exploitant les
activations internes, les cartes dŠattention et les probabilités token-par-token dŠun LLM auxiliaire.
Lorsque des références véridiques sont disponibles Ů par exemple dans la génération
augmentée par recherche (RAG) Ů notre cadre sŠy intègre naturellement pour accroître la
Ąabilité. Sur plusieurs jeux de données ouverts, nos méthodes réduisent le temps dŠinférence
jusquŠà 45× (boîte blanche) et 450× (boîte noire) par rapport aux baselines, tout en améliorant
nettement lŠAUC et le F1. Ces résultats démontrent quŠune détection des hallucinations
à la fois en temps réel et précise est possible sans compromis sur lŠefficacité computationnelle. |