De la négation dans les mesures anti-hallucination
Constat empirique, fait en construisant un assistant documentaire local (recherche augmentée sur manuels d'atelier et archives de forums) : la consigne « n'invente pas si tu ne trouves rien dans les sources » marche mal. Le modèle invente quand même. La consigne suivante, elle, marche nettement mieux :
« Si tu ne trouves rien dans une source, dis-le, et argumente sur pourquoi on n'y trouve rien sur le sujet étudié. »
Même objectif, formulation inversée, résultats sans comparaison. Ça évoque l'éducation positive — dire quoi faire plutôt que quoi ne pas faire — et le parallèle est plus solide qu'une simple analogie. Trois mécanismes l'expliquent.
1. L'éléphant rose
« Ne pense pas à un éléphant rose » : vous venez d'y penser. Un modèle de langage a le même problème, en pire. La négation n'y est pas un opérateur logique qui supprimerait un concept : c'est un mot comme un autre, posé à côté du concept. Écrire « n'invente pas » active la représentation d'« inventer ». cela la rend plus présente au moment précis où on voudrait qu'elle soit improbable au sens statistique. Au mieux, le modèle apprend à l'inhiber ensuite ; au pire, on vient de rendre saillant le comportement à éviter.
2. L'interdit ne dit pas quoi faire à la place
C'est le mécanisme principal. Au moment où l'assistant ne trouve rien dans les sources, il doit quand même générer quelque chose — un modèle de langage ne peut pas se taire. « N'invente pas » supprime (mal) un embranchement sans en fournir d'autre. Le modèle arrive au point de décision avec un vide, et le chemin de moindre résistance dans ce vide, c'est la complétion plausible, c'est-à-dire l'invention. On a interdit la seule sortie disponible sans proposer une alternative.
La formulation positive fait le travail inverse : elle transforme le cas d'échec en livrable. « Dis-le et argumente sur pourquoi la source n'en parle pas » donne au modèle une tâche générative concrète, avec du contenu à produire — analyser le périmètre de la source, son époque, son public, les raisons structurelles du silence. L'honnêteté cesse d'être une abstention (pauvre et terne à générer) pour devenir une production (riche). On a réaligné la tendance naturelle du modèle — produire du texte fluide et fourni — avec le comportement voulu, au lieu de lutter contre elle.
3. Les données d'entraînement n'ont pas de bons exemples de « rien »
Les corpus d'entraînement regorgent de réponses complètes et assertives. Ils contiennent très peu d'exemples de « je ne trouve pas, et voici pourquoi c'est normal ». Une consigne positive détaillée compense cette rareté : elle spécifie le format cible que les données n'ont pas appris. Une consigne négative laisse le modèle retomber sur sa fonction par défaut, qui est de répondre quelque chose.
La règle générale : faire du résultat vide un livrable
Le principe dépasse le cas de l'invention. Chaque fois qu'on veut interdire un comportement à un modèle, la vraie question est : que doit-il produire à la place, et cette production est-elle définie, légitime et gratifiante ?
Autre cas vécu, sur un pipeline d'extraction de fiches techniques depuis des sources anciennes : l'extracteur classait des arguments commerciaux qualitatifs (« rendement remarquable », « économie considérable ») comme des données de performance. La correction efficace n'a pas été de lui dire « ne classe pas les claims marketing en performances », mais une définition positive accompagnée d'une légitimation explicite du cas vide :
« performances = mesures quantifiées uniquement. Une fiche sans performance est légitime si la source ne contient pas de chiffres. »
La seconde phrase est la plus importante. Sans elle, une fiche vide « a l'air d'un échec », et le modèle remplit. Avec elle, le vide devient un résultat respectable — donc livrable.
Version cynique, mais exacte : ce n'est pas de la bienveillance, c'est de l'ingénierie de distribution de probabilité. Un modèle de langage, comme un enfant, apprend par imitation de comportements disponibles, pas par déduction à partir d'interdits. Montrez le geste de remplacement, pas seulement la faute.
Billet co-produit avec un LLM (Claude, Anthropic). Les observations empiriques et les cas d'application viennent de mes projets ; l'explicitation des mécanismes vient du modèle. Relecture et décision finale : humaines.