Détection d'hallucinations : qui travaille dessus, sur quoi
Cartographie pour Aletheia / Berlue : les collectifs qui produisent des données et des évaluations partagées, la littérature qui structure le champ, et ce qui en est arrivé jusqu'à la presse. Chaque entrée porte un lien direct. La dernière section note explicitement ce que je n'ai pas pu vérifier — sujet oblige.
Le clivage qui structure tout
Factualité (la sortie contredit le monde réel) contre fidélité (la sortie contredit le contexte fourni). Berlue étant un détecteur, la question « lequel des deux » détermine s'il faut une source de vérité externe ou seulement le contexte d'entrée.
Le clivage méthodologique
Boîte noire (échantillonnage et cohérence : SelfCheckGPT, entropie sémantique) contre boîte blanche (sondes sur états internes, attention, logits). Le second est plus précis et quasi gratuit à l'inférence, mais suppose l'accès aux poids du modèle jugé.
Où se joue la compétition
Les shared tasks (*SHROOM) fournissent l'annotation au niveau span, le seul format qui permet de dire où ça hallucine et pas seulement si. C'est le format le plus proche de ce qu'Aletheia doit afficher.
1. Groupes de travail et communautés
Workshops et lieux de publication
UncertaiNLP
3e édition à EMNLP 2026, Budapest, 29 octobre 2026. Le workshop dédié à l'incertitude en TAL — hôte de SHROOM-Visions. uncertainlp.github.io
TrustNLP
6e Trustworthy NLP Workshop à ACL 2026. Traite l'hallucination comme un thème parmi la confiance, la robustesse et les biais. Appel ACL
REALM
Workshop EMNLP 2026 sur les systèmes à mémoire et récupération — pertinent pour la fidélité en RAG. realm-workshop.github.io
Conférences principales
ACL / EMNLP / NAACL (via ACL Rolling Review), ICLR et NeurIPS. Les travaux les plus cités du domaine sortent de ces quatre. CFP EMNLP 2026
Laboratoires identifiables
- OATML — Oxford
- Le groupe de Yarin Gal (avec Sebastian Farquhar, Jannik Kossen, Lorenz Kuhn), auteur de l'entropie sémantique publiée dans Nature en 2024 — la référence la plus citée côté détection non supervisée. Financement partiel Alan Turing Institute. Annonce Oxford CS
- Stanford RegLab / HAI
- Mesure empirique des hallucinations en contexte juridique, y compris sur les outils commerciaux (Lexis+ AI, Westlaw). Produit aussi HELM et MedHELM côté évaluation. RegLab
- Helsinki NLP
- Porte la série *SHROOM ci-dessus.
- OpenAI (recherche)
- Kalai, Nachum, Vempala et al. — l'argument « les évaluations récompensent le bluff », repris dans Nature. Voir section causes.
Normalisation et institutions
| Organisme | Travaux | Statut |
|---|---|---|
| CEN-CENELEC JTC 21 | Normes harmonisées pour l'AI Act. prEN 18229-2 « Trustworthiness
framework — Accuracy and Robustness » ; prEN ISO/IEC 23282 méthodes
d'évaluation des systèmes TAL. |
brouillons travail en cours
jtc21.eu · CEN-CENELEC |
| NIST | AI 100-5 — plan d'engagement sur les normes IA ; identifie terminologie, taxonomie et méthodes de test/évaluation/vérification/validation comme urgentes. | PDF NIST |
| ISO/IEC | ISO/IEC 42001, premier système de management de l'IA certifiable — cadre dans lequel la validation des sorties se justifie côté gouvernance. | publié |
| Réseau AISI | International AI Safety Report, coordonné par Yoshua Bengio. | arXiv 2501.17805 |
France et Europe
INESIA
Institut national pour l'évaluation et la sécurité de l'IA, sous coordination SGDSN. Il fédère Inria, le LNE, le PEReN et l'ANSSI. C'est l'interlocuteur institutionnel naturel côté français, et il a annoncé un leaderboard avec le LNE intégrant des benchmarks en langue française — un point d'accroche direct si Berlue vise le francophone.
Inria — création de l'INESIA · SGDSN · PEReN — test conjoint d'agents
LNE — évaluation des systèmes d'IA
Partenariat cadre Inria-LNE pour un programme « Évaluation de l'IA » : recherche, expérimentation, contrôle. Le LNE est le laboratoire de métrologie — le seul acteur français dont le métier est littéralement de définir comment on mesure. lne.fr
AFNOR
Groupe de travail IA (miroir national de JTC 21), auquel l'ANSSI participe. Voie d'entrée si l'objectif est de peser sur la définition des méthodes d'évaluation plutôt que de les subir. ANSSI — IA
Éditeurs et open source — les concurrents directs de Berlue
| Projet | Nature | Ce qu'il apporte | Lien |
|---|---|---|---|
| Vectara HHEM | Modèle + leaderboard | HHEM-2.1-open est le modèle open source de facto pour la fidélité en RAG.
Le Hallucination Leaderboard associé est « vivant » : modèle d'évaluation et
documents sources mis à jour en continu. |
Hugging Face |
| Patronus Lynx | Modèle open weights | 8B et 70B, détection de fidélité RAG, intégrable comme rail NeMo-Guardrails. Option quand l'auto-hébergement est exigé (secteurs régulés). | Patronus |
| LettuceDetect | Framework MIT | Classifieur au niveau token sur ModernBERT — contexte long, licence permissive. La granularité span, comme Mu-SHROOM. | Blog HF |
| RAGAS | Framework d'éval | Métriques de faithfulness / answer relevancy, très répandu comme couche de mesure. | open source |
| NeMo Guardrails | Rails NVIDIA | Couche de garde-fous avec rails fact-checking et grounding — pas un détecteur en soi. | open source |
Architecture que la pratique a fait converger
Un petit détecteur rapide sur chaque requête (HHEM, Lynx, Luna) pour le scoring en ligne, plus un LLM-juge sur un sous-échantillon pour l'analyse fine. Le tout-LLM-juge ne passe pas à l'échelle en coût, le tout-petit-modèle rate les cas subtils.
2. Papiers de recherche
Surveys — par où commencer
- Huang et al., A Survey on Hallucination in LLMs: Principles, Taxonomy, Challenges, and Open Questions — ACM TOIS. La taxonomie factualité / fidélité que tout le monde reprend. arXiv 2311.05232
- Large Language Models Hallucination: A Comprehensive Survey (2026) — taxonomies structurées des approches de détection et des stratégies de mitigation. arXiv 2510.06265
- Lifecycle-Based Survey (2026) — découpe les hallucinations en données / entraînement / inférence, utile pour situer où un détecteur agit. arXiv 2608.26168 à vérifier
- Uncertainty Quantification for Hallucination Detection — fondements, méthodologie, directions. arXiv 2510.12040
- Hallucination to Truth — revue du fact-checking et de l'évaluation de factualité, publiée dans Artificial Intelligence Review. Springer · arXiv 2508.03860
- A Survey of Multimodal Hallucination Evaluation and Detection — le versant vision-langage. arXiv 2507.19024
Causes et théorie
Why Language Models Hallucinate
Kalai, Nachum, Vempala et al. (OpenAI). Deux thèses : (1) les hallucinations sont statistiquement prévisibles dès le pré-entraînement — un taux borné par le double du taux d'erreur de classification ; (2) elles persistent parce que les évaluations notent « je ne sais pas » comme une erreur, ce qui rend le bluff rentable. Remède proposé : barème avec réponse correcte positive, abstention à zéro, erreur négative.
arXiv 2509.04664 · Billet OpenAI · Version Nature (2026)
Pourquoi ça compte pour Berlue
Un détecteur qui note l'abstention comme un succès change l'incitation en aval. Si Aletheia expose un score, la façon dont il traite « je ne sais pas » est une décision de conception, pas un détail.
Méthodes de détection
Boîte noire — cohérence entre échantillons
- SelfCheckGPT (Manakul et al., EMNLP 2023) — plusieurs générations pour le même prompt, incohérence = signal d'hallucination. La baseline que tout le monde bat.
- Entropie sémantique (Farquhar, Kossen, Kuhn, Gal — Nature 2024) — l'incertitude est calculée au niveau du sens : on regroupe les réponses sémantiquement équivalentes avant de calculer l'entropie. Distingue « le modèle hésite sur la formulation » de « le modèle hésite sur le fait ».
- Semantic Entropy Probes — approxime l'entropie sémantique depuis les états cachés d'une seule génération. Ramène le coût à quasi zéro : c'est l'astuce qui rend la méthode déployable. arXiv 2406.15927
- FactSelfCheck — même idée descendue au niveau du fait individuel plutôt que de la phrase. arXiv 2503.17229
- Semantic Energy — au-delà de l'entropie. arXiv 2508.14496
Boîte blanche — sondes sur l'interne
- Sondes d'états cachés — classifieur linéaire sur les représentations d'une couche donnée. Famille dominante.
- Sondes dynamiques — quantifient le flux d'information entre couches plutôt qu'un instantané.
- Structure d'attention — divergence topologique sur les graphes d'attention (arXiv 2504.10063), features spectrales des cartes d'attention (arXiv 2502.17598).
- LLM-Check — détection depuis logits et états internes, sans échantillonnage multiple. PDF
- Détection temps réel non supervisée depuis les états internes. arXiv 2403.06448
Spécifique RAG
- ReDeEP (ICLR 2025) — détection via interprétabilité mécaniste : sépare ce que le modèle tire du contexte de ce qu'il tire de sa mémoire paramétrique.
- Lynx, HHEM, LettuceDetect — voir la section industrie ; ce sont aussi des papiers.
- Luna — modèle d'évaluation dédié, précision élevée et coût faible. arXiv 2406.00975
Garanties statistiques
- Principled Detection via Multiple Testing — cadre de tests multiples, donc contrôle explicite du taux de faux positifs. Intéressant dès qu'il faut promettre un seuil à un utilisateur. arXiv 2508.18473
Benchmarks et leaderboards
| Benchmark | Cible | Note |
|---|---|---|
| Mu-SHROOM | Spans, 14 langues | Le plus aligné avec un affichage type Aletheia. lien |
| Vectara Hallucination Leaderboard | Fidélité en résumé / RAG | Leaderboard vivant, HHEM-2.1-open comme juge. |
| HalluLens | Généraliste | ACL 2025, sépare explicitement hallucination extrinsèque et intrinsèque. arXiv 2504.17550 |
| FaithBench | Résumé | NAACL 2025, annotations humaines sur des LLM récents. |
| TruthfulQA | Factualité adversariale | Historique, saturé sur les modèles récents mais toujours cité. |
| HELM / MedHELM | Holistique, médical | Stanford CRFM ; MedHELM construit avec Stanford BMIR, Stanford Health Care et Microsoft Health, cliniciens de 15 spécialités. |
| OpenHalDet, HalluScore, CAP, HALC-Bench | Unifié, QA, scientifique, contexte long | Vague 2026, à évaluer au cas par cas. à vérifier |
Verticales — juridique et médical
Juridique
- Large Legal Fictions (Stanford, 2024) — plus de 800 000 questions juridiques vérifiables, taux d'hallucination de 58 % à 88 % sur les modèles généralistes de 2023.
- Hallucination-Free? — mise à l'épreuve des outils commerciaux (Lexis+ AI, Westlaw AI-Assisted Research). RegLab
- AI on Trial — synthèse HAI grand public. Stanford HAI
- Veille continue côté bibliothécaires juridiques : AI Law Librarians
Médical
- MedHalu — hallucinations sur des questions de santé posées par des patients. arXiv 2409.19492
- MedHELM — extension médicale de HELM.
- ClinHallu, détection/correction dans les VLM médicaux par contre-évidence — vague 2026. à vérifier
Citations inventées : le cas d'usage le plus lisible
C'est le type d'hallucination le plus facile à vérifier automatiquement (la référence existe ou non) et le plus dommageable en pratique. Voir LLM hallucinations in the wild: Large-scale evidence from non-existent citations (arXiv 2605.07723) et HalluCitation Matters (arXiv 2601.18724). à vérifier
3. Publications grand public
Anglophone
- OpenAI — Why language models hallucinate, le billet de vulgarisation le plus repris de 2025-2026. openai.com
- Nature — Evaluating LLMs for accuracy incentivizes hallucinations, qui fait passer l'argument des incitations dans la presse scientifique généraliste. nature.com
- Axios — AI is still getting things wrong, more confidently than ever (mai 2026). axios.com
- Étude Oxford Internet Institute / Nature — les chatbots plus « chaleureux » produisent plus d'erreurs ; angle design, pas seulement modèle. résumé
- Live Science — l'effet en retour : l'usage de chatbots amplifie les croyances erronées de l'utilisateur. livescience.com
- Tech.co — liste tenue à jour des incidents publics. tech.co
- The Walrus — quand un média de référence se fait prendre à publier des hallucinations. thewalrus.ca
Francophone
- Le Temps — L'intelligence artificielle hallucine toujours énormément, mais il y a des pistes pour limiter les dégâts. Le papier de vulgarisation le plus complet en français. letemps.ch
- Le Grand Continent — Le modèle économique de ChatGPT repose sur ses hallucinations (mars 2026). Angle économique, utile pour un pitch. legrandcontinent.eu
- Slate.fr — D'où viennent les « hallucinations » des chatbots ? Explication du mécanisme, niveau grand public. slate.fr
- Wikipédia FR — Hallucination (intelligence artificielle), article correctement sourcé, bon point de départ pour la terminologie française. fr.wikipedia.org
- LNE — Intelligence artificielle : un cadre de confiance urgent, la position institutionnelle française. lne.fr
- Critique du terme — AI Hallucinations: A Misnomer Worth Clarifying. Argument à connaître : « hallucination » anthropomorphise et brouille le débat. arXiv 2401.06796
4. Ce qu'on en tire pour Berlue
Baselines à battre
HHEM-2.1-open et Lynx pour la fidélité RAG, LettuceDetect pour le span-level, SelfCheckGPT et les Semantic Entropy Probes pour le sans-contexte. Ce sont les quatre chiffres qu'un lecteur technique attendra à côté de ceux de Berlue.
Jeux d'évaluation à brancher
Mu-SHROOM d'abord (spans, français inclus, 43 équipes de référence), puis FaithBench
ou HalluLens selon que la cible est le résumé ou le généraliste. Le
claude-doc/plan-branchement-eval.md existant est le bon endroit où poser ça.
Décision de conception à trancher
Factualité ou fidélité — Berlue ne peut pas répondre aux deux avec le même signal. La fidélité ne demande que le contexte ; la factualité demande une source de vérité et change tout le coût d'exploitation.
Angle différenciant possible
Le francophone est peu couvert par les détecteurs open source, et l'INESIA annonce justement un leaderboard avec benchmarks en français. Fenêtre étroite mais réelle.
5. Niveau de fiabilité de ce dossier
Sujet oblige : voici ce que je tiens pour établi et ce qui reste à confirmer.
| Catégorie | Statut | Détail |
|---|---|---|
| Groupes, workshops, institutions | solide | Sites officiels, appels à communication, pages institutionnelles. Vérifier seulement les dates exactes de deadline avant de s'en servir. |
| Papiers antérieurs à mi-2026 | solide | Identifiants arXiv et ACL Anthology recoupés. |
| Papiers arXiv 26xx (2026) | à vérifier | Identifiants remontés par la recherche mais non ouverts un par un. Les vérifier avant toute citation — c'est exactement le mode d'échec que Berlue détecte. |
| Chiffres de taux d'hallucination | prudence | Plusieurs pages agrégatrices (sqmagazine, suprmind, blogs « statistiques 2026 ») citent des taux sans méthodologie traçable, et j'ai vu passer au moins un benchmark (« BullshitBench v2 ») dont je n'ai trouvé aucune source primaire. Ne rien reprendre de ces chiffres sans remonter au papier. |
| Références normatives (prEN) | à vérifier | Numéros et intitulés issus de résumés secondaires ; à confirmer sur le catalogue CEN-CENELEC, les brouillons évoluent. |
Recherche effectuée le 3 septembre 2026 par recherche web. Un dossier de veille périme vite sur ce sujet : les shared tasks et les leaderboards vivants sont les seuls points d'ancrage qui restent valables plusieurs mois.