Aletheia · Veille
Détection d'hallucinations LLM — état du terrain, septembre 2026

Détection d'hallucinations : qui travaille dessus, sur quoi

Cartographie pour Aletheia / Berlue : les collectifs qui produisent des données et des évaluations partagées, la littérature qui structure le champ, et ce qui en est arrivé jusqu'à la presse. Chaque entrée porte un lien direct. La dernière section note explicitement ce que je n'ai pas pu vérifier — sujet oblige.

Le clivage qui structure tout

Factualité (la sortie contredit le monde réel) contre fidélité (la sortie contredit le contexte fourni). Berlue étant un détecteur, la question « lequel des deux » détermine s'il faut une source de vérité externe ou seulement le contexte d'entrée.

Le clivage méthodologique

Boîte noire (échantillonnage et cohérence : SelfCheckGPT, entropie sémantique) contre boîte blanche (sondes sur états internes, attention, logits). Le second est plus précis et quasi gratuit à l'inférence, mais suppose l'accès aux poids du modèle jugé.

Où se joue la compétition

Les shared tasks (*SHROOM) fournissent l'annotation au niveau span, le seul format qui permet de dire ça hallucine et pas seulement si. C'est le format le plus proche de ce qu'Aletheia doit afficher.

1. Groupes de travail et communautés

Shared tasks — la communauté la plus directement utile

La série *SHROOM (Helsinki NLP) est le noyau communautaire du sujet : jeux de données annotés, protocole d'évaluation partagé, dizaines d'équipes qui publient leurs systèmes chaque année. C'est là qu'on trouve des baselines reproductibles.

ÉditionCadreApportLien
SHROOMSemEval-2024, tâche 6 4 000 sorties annotées par 5 annotateurs, sur 3 tâches (traduction, paraphrase, modélisation de définitions). 42 équipes, 27 system papers. arXiv 2403.07726
Mu-SHROOMSemEval-2025, tâche 3 Multilingue (14 langues) et au niveau span. 43 équipes, 2 618 soumissions. Pointe le désaccord inter-annotateurs comme difficulté centrale. ACL Anthology · arXiv 2504.11975
SHROOM-VisionsUncertaiNLP @ EMNLP 2026 4e édition, étendue aux modèles vision-langage, spans fins sur 4 langues. en cours helsinki-nlp.github.io/shroom
Pourquoi c'est la première porte d'entrée

Les données Mu-SHROOM sont publiques, en français parmi d'autres langues, et au format span — exactement la granularité qu'un front comme Aletheia doit surligner. Un score sur Mu-SHROOM est aussi la façon la plus rapide de situer Berlue face à 43 équipes déjà mesurées sur le même terrain.

Workshops et lieux de publication

UncertaiNLP

3e édition à EMNLP 2026, Budapest, 29 octobre 2026. Le workshop dédié à l'incertitude en TAL — hôte de SHROOM-Visions. uncertainlp.github.io

TrustNLP

6e Trustworthy NLP Workshop à ACL 2026. Traite l'hallucination comme un thème parmi la confiance, la robustesse et les biais. Appel ACL

REALM

Workshop EMNLP 2026 sur les systèmes à mémoire et récupération — pertinent pour la fidélité en RAG. realm-workshop.github.io

Conférences principales

ACL / EMNLP / NAACL (via ACL Rolling Review), ICLR et NeurIPS. Les travaux les plus cités du domaine sortent de ces quatre. CFP EMNLP 2026

Laboratoires identifiables

OATML — Oxford
Le groupe de Yarin Gal (avec Sebastian Farquhar, Jannik Kossen, Lorenz Kuhn), auteur de l'entropie sémantique publiée dans Nature en 2024 — la référence la plus citée côté détection non supervisée. Financement partiel Alan Turing Institute. Annonce Oxford CS
Stanford RegLab / HAI
Mesure empirique des hallucinations en contexte juridique, y compris sur les outils commerciaux (Lexis+ AI, Westlaw). Produit aussi HELM et MedHELM côté évaluation. RegLab
Helsinki NLP
Porte la série *SHROOM ci-dessus.
OpenAI (recherche)
Kalai, Nachum, Vempala et al. — l'argument « les évaluations récompensent le bluff », repris dans Nature. Voir section causes.

Normalisation et institutions

OrganismeTravauxStatut
CEN-CENELEC JTC 21 Normes harmonisées pour l'AI Act. prEN 18229-2 « Trustworthiness framework — Accuracy and Robustness » ; prEN ISO/IEC 23282 méthodes d'évaluation des systèmes TAL. brouillons travail en cours
jtc21.eu · CEN-CENELEC
NIST AI 100-5 — plan d'engagement sur les normes IA ; identifie terminologie, taxonomie et méthodes de test/évaluation/vérification/validation comme urgentes. PDF NIST
ISO/IEC ISO/IEC 42001, premier système de management de l'IA certifiable — cadre dans lequel la validation des sorties se justifie côté gouvernance. publié
Réseau AISI International AI Safety Report, coordonné par Yoshua Bengio. arXiv 2501.17805

France et Europe

INESIA

Institut national pour l'évaluation et la sécurité de l'IA, sous coordination SGDSN. Il fédère Inria, le LNE, le PEReN et l'ANSSI. C'est l'interlocuteur institutionnel naturel côté français, et il a annoncé un leaderboard avec le LNE intégrant des benchmarks en langue française — un point d'accroche direct si Berlue vise le francophone.

Inria — création de l'INESIA · SGDSN · PEReN — test conjoint d'agents

LNE — évaluation des systèmes d'IA

Partenariat cadre Inria-LNE pour un programme « Évaluation de l'IA » : recherche, expérimentation, contrôle. Le LNE est le laboratoire de métrologie — le seul acteur français dont le métier est littéralement de définir comment on mesure. lne.fr

AFNOR

Groupe de travail IA (miroir national de JTC 21), auquel l'ANSSI participe. Voie d'entrée si l'objectif est de peser sur la définition des méthodes d'évaluation plutôt que de les subir. ANSSI — IA

Éditeurs et open source — les concurrents directs de Berlue

ProjetNatureCe qu'il apporteLien
Vectara HHEMModèle + leaderboard HHEM-2.1-open est le modèle open source de facto pour la fidélité en RAG. Le Hallucination Leaderboard associé est « vivant » : modèle d'évaluation et documents sources mis à jour en continu. Hugging Face
Patronus LynxModèle open weights 8B et 70B, détection de fidélité RAG, intégrable comme rail NeMo-Guardrails. Option quand l'auto-hébergement est exigé (secteurs régulés). Patronus
LettuceDetectFramework MIT Classifieur au niveau token sur ModernBERT — contexte long, licence permissive. La granularité span, comme Mu-SHROOM. Blog HF
RAGASFramework d'éval Métriques de faithfulness / answer relevancy, très répandu comme couche de mesure. open source
NeMo GuardrailsRails NVIDIA Couche de garde-fous avec rails fact-checking et grounding — pas un détecteur en soi. open source
Architecture que la pratique a fait converger

Un petit détecteur rapide sur chaque requête (HHEM, Lynx, Luna) pour le scoring en ligne, plus un LLM-juge sur un sous-échantillon pour l'analyse fine. Le tout-LLM-juge ne passe pas à l'échelle en coût, le tout-petit-modèle rate les cas subtils.

2. Papiers de recherche

Surveys — par où commencer

  • Huang et al., A Survey on Hallucination in LLMs: Principles, Taxonomy, Challenges, and Open Questions — ACM TOIS. La taxonomie factualité / fidélité que tout le monde reprend. arXiv 2311.05232
  • Large Language Models Hallucination: A Comprehensive Survey (2026) — taxonomies structurées des approches de détection et des stratégies de mitigation. arXiv 2510.06265
  • Lifecycle-Based Survey (2026) — découpe les hallucinations en données / entraînement / inférence, utile pour situer où un détecteur agit. arXiv 2608.26168 à vérifier
  • Uncertainty Quantification for Hallucination Detection — fondements, méthodologie, directions. arXiv 2510.12040
  • Hallucination to Truth — revue du fact-checking et de l'évaluation de factualité, publiée dans Artificial Intelligence Review. Springer · arXiv 2508.03860
  • A Survey of Multimodal Hallucination Evaluation and Detection — le versant vision-langage. arXiv 2507.19024

Causes et théorie

Why Language Models Hallucinate

Kalai, Nachum, Vempala et al. (OpenAI). Deux thèses : (1) les hallucinations sont statistiquement prévisibles dès le pré-entraînement — un taux borné par le double du taux d'erreur de classification ; (2) elles persistent parce que les évaluations notent « je ne sais pas » comme une erreur, ce qui rend le bluff rentable. Remède proposé : barème avec réponse correcte positive, abstention à zéro, erreur négative.

arXiv 2509.04664 · Billet OpenAI · Version Nature (2026)

Pourquoi ça compte pour Berlue

Un détecteur qui note l'abstention comme un succès change l'incitation en aval. Si Aletheia expose un score, la façon dont il traite « je ne sais pas » est une décision de conception, pas un détail.

Méthodes de détection

Boîte noire — cohérence entre échantillons

  • SelfCheckGPT (Manakul et al., EMNLP 2023) — plusieurs générations pour le même prompt, incohérence = signal d'hallucination. La baseline que tout le monde bat.
  • Entropie sémantique (Farquhar, Kossen, Kuhn, Gal — Nature 2024) — l'incertitude est calculée au niveau du sens : on regroupe les réponses sémantiquement équivalentes avant de calculer l'entropie. Distingue « le modèle hésite sur la formulation » de « le modèle hésite sur le fait ».
  • Semantic Entropy Probes — approxime l'entropie sémantique depuis les états cachés d'une seule génération. Ramène le coût à quasi zéro : c'est l'astuce qui rend la méthode déployable. arXiv 2406.15927
  • FactSelfCheck — même idée descendue au niveau du fait individuel plutôt que de la phrase. arXiv 2503.17229
  • Semantic Energy — au-delà de l'entropie. arXiv 2508.14496

Boîte blanche — sondes sur l'interne

  • Sondes d'états cachés — classifieur linéaire sur les représentations d'une couche donnée. Famille dominante.
  • Sondes dynamiques — quantifient le flux d'information entre couches plutôt qu'un instantané.
  • Structure d'attention — divergence topologique sur les graphes d'attention (arXiv 2504.10063), features spectrales des cartes d'attention (arXiv 2502.17598).
  • LLM-Check — détection depuis logits et états internes, sans échantillonnage multiple. PDF
  • Détection temps réel non supervisée depuis les états internes. arXiv 2403.06448

Spécifique RAG

  • ReDeEP (ICLR 2025) — détection via interprétabilité mécaniste : sépare ce que le modèle tire du contexte de ce qu'il tire de sa mémoire paramétrique.
  • Lynx, HHEM, LettuceDetect — voir la section industrie ; ce sont aussi des papiers.
  • Luna — modèle d'évaluation dédié, précision élevée et coût faible. arXiv 2406.00975

Garanties statistiques

  • Principled Detection via Multiple Testing — cadre de tests multiples, donc contrôle explicite du taux de faux positifs. Intéressant dès qu'il faut promettre un seuil à un utilisateur. arXiv 2508.18473

Benchmarks et leaderboards

BenchmarkCibleNote
Mu-SHROOMSpans, 14 langues Le plus aligné avec un affichage type Aletheia. lien
Vectara Hallucination LeaderboardFidélité en résumé / RAG Leaderboard vivant, HHEM-2.1-open comme juge.
HalluLensGénéraliste ACL 2025, sépare explicitement hallucination extrinsèque et intrinsèque. arXiv 2504.17550
FaithBenchRésumé NAACL 2025, annotations humaines sur des LLM récents.
TruthfulQAFactualité adversariale Historique, saturé sur les modèles récents mais toujours cité.
HELM / MedHELMHolistique, médical Stanford CRFM ; MedHELM construit avec Stanford BMIR, Stanford Health Care et Microsoft Health, cliniciens de 15 spécialités.
OpenHalDet, HalluScore, CAP, HALC-Bench Unifié, QA, scientifique, contexte long Vague 2026, à évaluer au cas par cas. à vérifier

Verticales — juridique et médical

Juridique

  • Large Legal Fictions (Stanford, 2024) — plus de 800 000 questions juridiques vérifiables, taux d'hallucination de 58 % à 88 % sur les modèles généralistes de 2023.
  • Hallucination-Free? — mise à l'épreuve des outils commerciaux (Lexis+ AI, Westlaw AI-Assisted Research). RegLab
  • AI on Trial — synthèse HAI grand public. Stanford HAI
  • Veille continue côté bibliothécaires juridiques : AI Law Librarians

Médical

  • MedHalu — hallucinations sur des questions de santé posées par des patients. arXiv 2409.19492
  • MedHELM — extension médicale de HELM.
  • ClinHallu, détection/correction dans les VLM médicaux par contre-évidence — vague 2026. à vérifier
Citations inventées : le cas d'usage le plus lisible

C'est le type d'hallucination le plus facile à vérifier automatiquement (la référence existe ou non) et le plus dommageable en pratique. Voir LLM hallucinations in the wild: Large-scale evidence from non-existent citations (arXiv 2605.07723) et HalluCitation Matters (arXiv 2601.18724). à vérifier

3. Publications grand public

Anglophone

  • OpenAIWhy language models hallucinate, le billet de vulgarisation le plus repris de 2025-2026. openai.com
  • NatureEvaluating LLMs for accuracy incentivizes hallucinations, qui fait passer l'argument des incitations dans la presse scientifique généraliste. nature.com
  • AxiosAI is still getting things wrong, more confidently than ever (mai 2026). axios.com
  • Étude Oxford Internet Institute / Nature — les chatbots plus « chaleureux » produisent plus d'erreurs ; angle design, pas seulement modèle. résumé
  • Live Science — l'effet en retour : l'usage de chatbots amplifie les croyances erronées de l'utilisateur. livescience.com
  • Tech.co — liste tenue à jour des incidents publics. tech.co
  • The Walrus — quand un média de référence se fait prendre à publier des hallucinations. thewalrus.ca

Francophone

  • Le TempsL'intelligence artificielle hallucine toujours énormément, mais il y a des pistes pour limiter les dégâts. Le papier de vulgarisation le plus complet en français. letemps.ch
  • Le Grand ContinentLe modèle économique de ChatGPT repose sur ses hallucinations (mars 2026). Angle économique, utile pour un pitch. legrandcontinent.eu
  • Slate.frD'où viennent les « hallucinations » des chatbots ? Explication du mécanisme, niveau grand public. slate.fr
  • Wikipédia FRHallucination (intelligence artificielle), article correctement sourcé, bon point de départ pour la terminologie française. fr.wikipedia.org
  • LNEIntelligence artificielle : un cadre de confiance urgent, la position institutionnelle française. lne.fr
  • Critique du termeAI Hallucinations: A Misnomer Worth Clarifying. Argument à connaître : « hallucination » anthropomorphise et brouille le débat. arXiv 2401.06796

4. Ce qu'on en tire pour Berlue

Baselines à battre

HHEM-2.1-open et Lynx pour la fidélité RAG, LettuceDetect pour le span-level, SelfCheckGPT et les Semantic Entropy Probes pour le sans-contexte. Ce sont les quatre chiffres qu'un lecteur technique attendra à côté de ceux de Berlue.

Jeux d'évaluation à brancher

Mu-SHROOM d'abord (spans, français inclus, 43 équipes de référence), puis FaithBench ou HalluLens selon que la cible est le résumé ou le généraliste. Le claude-doc/plan-branchement-eval.md existant est le bon endroit où poser ça.

Décision de conception à trancher

Factualité ou fidélité — Berlue ne peut pas répondre aux deux avec le même signal. La fidélité ne demande que le contexte ; la factualité demande une source de vérité et change tout le coût d'exploitation.

Angle différenciant possible

Le francophone est peu couvert par les détecteurs open source, et l'INESIA annonce justement un leaderboard avec benchmarks en français. Fenêtre étroite mais réelle.

5. Niveau de fiabilité de ce dossier

Sujet oblige : voici ce que je tiens pour établi et ce qui reste à confirmer.

CatégorieStatutDétail
Groupes, workshops, institutionssolide Sites officiels, appels à communication, pages institutionnelles. Vérifier seulement les dates exactes de deadline avant de s'en servir.
Papiers antérieurs à mi-2026solide Identifiants arXiv et ACL Anthology recoupés.
Papiers arXiv 26xx (2026)à vérifier Identifiants remontés par la recherche mais non ouverts un par un. Les vérifier avant toute citation — c'est exactement le mode d'échec que Berlue détecte.
Chiffres de taux d'hallucinationprudence Plusieurs pages agrégatrices (sqmagazine, suprmind, blogs « statistiques 2026 ») citent des taux sans méthodologie traçable, et j'ai vu passer au moins un benchmark (« BullshitBench v2 ») dont je n'ai trouvé aucune source primaire. Ne rien reprendre de ces chiffres sans remonter au papier.
Références normatives (prEN)à vérifier Numéros et intitulés issus de résumés secondaires ; à confirmer sur le catalogue CEN-CENELEC, les brouillons évoluent.

Recherche effectuée le 3 septembre 2026 par recherche web. Un dossier de veille périme vite sur ce sujet : les shared tasks et les leaderboards vivants sont les seuls points d'ancrage qui restent valables plusieurs mois.