Hallucinations de l’IA : pourquoi les astuces ne suffisent pas

Équipe Merlya · mis à jour le 25 septembre 2026

En bref : aucune formulation magique n’empêche une IA d’inventer. Les modèles devinent parce qu’on les a notés comme des élèves face à un questionnaire à choix multiples, où répondre au hasard rapporte plus que dire « je ne sais pas ». Pour une PME, la seule protection sérieuse tient en deux règles : exiger la source de chaque réponse, et faire valider par une personne avant tout envoi.

La promesse qui circule

Les articles du type « cinq astuces pour que votre IA arrête d’halluciner » continuent de sortir. L’un des plus racoleurs, publié sur un blog le 18 avril 2026, promet de réduire les hallucinations de 80 % en changeant simplement la façon de poser la question.

Le chiffre ne tient pas dans sa propre note de bas de page : l’étude citée mesure un taux d’invention qui passe de 38,3 % avec une consigne vague à 18,1 % avec une consigne plus structurée. C’est une amélioration réelle, mais ce n’est pas le chiffre du titre, et près d’une réponse sur cinq reste fausse même dans ce cas.

Ce que mesurent les études

ÉtudeCe qui a été mesuréRésultat
Linardon et al., JMIR Mental Health, 12 novembre 2025Références bibliographiques produites par GPT-4o pour six revues de littérature en santé mentale19,9 % des citations entièrement inventées, c’est-à-dire introuvables
Magesh, Surani, Dahl, Suzgun, Manning, Ho (Stanford RegLab), Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, mai 2024Outils de recherche juridique vendus comme fiables, branchés sur des bases documentairesEntre 17 et 33 % de réponses erronées selon l’outil
Kalai, Nachum, Vempala, Zhang, Why Language Models Hallucinate, septembre 2025Pourquoi les modèles invententL’entraînement et l’évaluation récompensent le fait de deviner plutôt que d’admettre qu’on ne sait pas

Trois enseignements s’en dégagent.

  • Une citation sur cinq inventée, et la proportion varie selon le sujet : plus il est pointu, plus l’outil invente. Or c’est précisément sur les sujets pointus qu’on a envie de lui demander de l’aide.
  • Brancher l’outil sur des documents aide, mais ne règle pas tout. Des outils juridiques présentés comme « sans hallucination », adossés à des bases documentaires sérieuses, se trompent encore entre 17 et 33 % du temps selon l’outil testé.
  • Le problème vient de la façon dont on note les modèles. L’équipe de chercheurs qui a publié Why Language Models Hallucinate en septembre 2025 montre que les modèles sont évalués comme à un questionnaire à choix multiples. Une case laissée vide ne rapporte jamais rien, une case cochée au hasard rapporte parfois un point. Le modèle a appris à cocher.

Alors, les consignes de prudence ne servent à rien ?

Ce serait faux de l’affirmer. Écrire à l’outil « n’invente rien » a un effet mesurable : il devient plus prudent. Mais cette prudence a un prix, il perd aussi des réponses justes. La consigne déplace l’erreur, elle ne la supprime pas.

La formule à retenir : une consigne agit sur ce que le modèle dit, pas sur ce qu’il sait. Lui donner les bons documents change l’ordre de grandeur des erreurs. Cela ne les fait pas disparaître.

Soignez donc la formulation des consignes, c’est utile. Mais ne comptez pas sur elle pour garantir un devis juste ou un cahier des charges sans erreur.

Ce que ça change pour une PME du Grand Est

Dans une PME industrielle ou de négoce, une erreur d’IA ne reste pas dans une conversation. Elle finit dans un devis envoyé au client, une référence de norme dans un cahier des charges, un prix recopié sur une facture. Le coût n’est pas théorique.

Quelques réflexes simples, à appliquer dès maintenant, quel que soit l’outil utilisé :

  1. Demander la source, et l’ouvrir. Une réponse sans source est une hypothèse. Une source citée mais jamais vérifiée peut elle-même être inventée : c’est exactement ce que mesure l’étude sur les citations.
  2. Se méfier davantage sur les sujets pointus. Une norme précise, une tolérance, une référence fournisseur : c’est là que l’outil invente le plus, et avec le même aplomb.
  3. Préférer un « je ne sais pas » à une réponse. Un outil qui avoue ne pas trouver vous fait gagner du temps. Un outil qui répond toujours vous en fait perdre au moment de la vérification.
  4. Garder une personne pour valider. Rien ne part chez un client sans avoir été relu par quelqu’un qui connaît le métier.

Pour la question voisine des données qu’on confie à ces outils, voir Peut-on mettre les données de l’entreprise dans ChatGPT ?

Comment Merlya aborde le problème

Nous ne prétendons pas avoir supprimé les hallucinations : les études ci-dessus montrent qu’aucun outil ne peut le promettre honnêtement. Notre méthode part de ce constat.

  • Chaque proposition renvoie à sa source : l’affaire, la page ou l’indice d’où elle vient. Vous pouvez vérifier d’un clic.
  • Si l’information n’existe pas dans vos documents, l’outil le dit au lieu de combler le trou.
  • Une personne valide avant tout envoi. L’outil prépare le devis ou le document, votre équipe décide.

C’est ce que nous appliquons au chiffrage des devis et à la rédaction des documents techniques.

En conclusion

Les astuces de formulation ont un effet, mais modeste et à double tranchant. Tant que les modèles seront notés sur des épreuves qui récompensent le pari, ils parieront. Le levier pour une entreprise n’est donc pas la phrase parfaite : c’est une organisation où chaque réponse est sourcée et chaque document relu avant de partir. Si vous voulez voir ce que cela donne sur vos propres devis, parlons-en.

Un cas précis en tête ? Trente minutes suffisent pour savoir si on peut vous aider. Réserver un créneau ou appeler le 01 86 99 83 55.