Aller au contenu principal
0 % lu11 min restantes

Exemple fictif. Un contrôleur de gestion montre une note de synthèse produite en quelques secondes. Elle est bien écrite, structurée, argumentée. Elle contient un chiffre qui n'existe pas et une référence réglementaire qui n'a jamais été publiée sous cette forme. Rien dans le document ne le signale.

C'est précisément l'enjeu de la fiabilité des modèles de langage. Il ne s'agit pas de savoir s'ils se trompent, tous les outils se trompent. Il s'agit de savoir qu'ils se trompent sans le manifester, ce qui supprime le signal sur lequel repose habituellement le contrôle. Un tableur qui plante affiche une erreur ; un modèle qui ne sait pas produit une phrase.

La question pratique pour une organisation n'est donc pas d'obtenir un modèle qui ne se trompe jamais, objectif hors d'atteinte, mais de construire un processus qui rende ses erreurs détectables avant qu'elles n'engagent. Cet article décrit comment.

Pourquoi un modèle produit des énoncés faux

Le mécanisme mérite d'être compris, parce qu'il détermine les remèdes. Un modèle de langage produit un texte en choisissant, mot après mot, la suite la plus vraisemblable au regard de ce qu'il a appris. Il optimise la plausibilité de l'énoncé, pas sa véracité.

Cette distinction est le cœur du sujet. Dans l'immense majorité des cas, l'énoncé le plus plausible est aussi le plus exact, parce que le texte exact est celui qui a été le plus souvent écrit. Mais quand l'information manque, le procédé ne s'arrête pas : il continue de produire l'énoncé le plus vraisemblable, qui est alors une invention parfaitement bien formée.

Il en découle une propriété contre-intuitive : le modèle est d'autant plus convaincant qu'il se trompe sur un sujet où la forme attendue est très codifiée. Une référence juridique inventée respecte scrupuleusement le format d'une référence juridique. Un chiffre inventé a l'ordre de grandeur d'un chiffre réel. C'est précisément ce respect de la forme qui rend l'erreur difficile à repérer.

Deux conséquences pratiques. D'abord, demander au modèle s'il est sûr de lui n'apporte rien : la réponse à cette question est produite par le même mécanisme que la réponse initiale. Ensuite, la fiabilité ne s'améliore pas en changeant de modèle, seulement en changeant de processus. Les progrès techniques réduisent la fréquence des erreurs ; ils ne suppriment pas leur caractère silencieux.

Trois types d'erreur, trois remèdes

Ranger toutes les erreurs sous le terme d'hallucination empêche d'y répondre correctement. Trois familles se distinguent nettement dans un contexte de gestion.

L'énoncé inventé

Le cas le plus connu : un chiffre, une source, une citation, une référence qui n'existent pas. Il se produit typiquement quand la question porte sur une information précise et peu répandue.

Le remède est le seul qui fonctionne vraiment : exiger la source vérifiable et la vérifier. Un énoncé sans source vérifiable ne doit jamais entrer dans un document de gestion. Cette règle est simple et son coût de mise en œuvre est faible, car elle ne s'applique qu'aux énoncés factuels précis, pas au texte rédactionnel.

L'énoncé périmé

Plus insidieux, parce qu'il a été vrai. Un taux, un seuil, une règle qui a changé depuis. Le modèle restitue l'état du monde tel qu'il l'a appris, sans percevoir qu'il a été modifié depuis.

Le remède n'est pas la vérification de plausibilité, qui échoue toujours ici puisque l'énoncé est plausible et l'était même exact. C'est la vérification de date : pour toute information susceptible de changer, remonter à la publication d'origine et contrôler sa version en vigueur. C'est particulièrement critique sur les sujets réglementaires, fiscaux et sociaux, où la règle change souvent et où l'erreur se voit immédiatement.

L'énoncé mal transposé

Le plus fréquent en gestion et le moins discuté. Le modèle produit une information exacte dans l'absolu mais inapplicable au cas d'espèce : une méthode valable pour un autre secteur, une règle qui ne s'applique qu'au-delà d'un certain seuil d'effectif, un ratio dont la définition diffère de celle qu'utilise l'entreprise.

Le remède ne relève ni de la source ni de la date, mais de la compétence métier du lecteur. C'est la raison pour laquelle l'usage d'un modèle par une personne qui ne maîtrise pas le domaine est nettement plus risqué que son usage par un expert, alors que l'intuition suggère l'inverse.

La règle du niveau d'engagement

La plupart des politiques d'usage échouent parce qu'elles classent par outil ou par type de donnée. La classification qui fonctionne porte sur ce que la sortie engage.

Niveau 1, l'usage exploratoire. Reformuler, résumer un document qu'on a soi-même, produire un premier jet, explorer des pistes. La sortie ne quitte pas l'auteur et sera retravaillée. Aucune vérification formelle n'est nécessaire, et en imposer une détruirait l'essentiel du gain.

Niveau 2, l'usage interne diffusé. Une note qui circule dans l'organisation, une synthèse présentée en réunion, une analyse transmise à un collègue. La vérification porte sur les énoncés factuels : tout chiffre et toute référence doivent être remontés à leur source. Le corps rédactionnel n'a pas besoin d'être vérifié.

Niveau 3, l'usage engageant. Tout ce qui sort de l'entreprise ou fonde une décision : réponse à un client, document contractuel, élément d'un dossier de financement, analyse servant d'appui à un arbitrage. La vérification est intégrale et tracée, avec identification nominative de la personne qui l'a effectuée.

Cette gradation résout un problème pratique important : elle rend la règle applicable. Une exigence de vérification systématique sur tous les usages est ignorée en quelques semaines parce qu'elle est manifestement disproportionnée sur le niveau 1. Une exigence graduée est tenue, parce qu'elle correspond à l'intuition de risque des utilisateurs.

Elle recoupe la logique du cadre européen sur l'intelligence artificielle, qui gradue lui aussi les obligations selon l'usage et le risque plutôt que selon la technologie employée.

Trois dispositifs de vérification, par ordre de coût

Vérifier coûte du temps. L'enjeu est d'obtenir le niveau de fiabilité requis au coût le plus faible, ce qui suppose de choisir le dispositif adapté plutôt que d'appliquer le plus lourd partout.

  • La vérification par la source, la moins coûteuse. L'auteur remonte à la publication d'origine de chaque énoncé factuel. Elle prend quelques minutes par document et couvre les énoncés inventés comme les énoncés périmés. C'est le dispositif à généraliser en premier.
  • Le contrôle croisé, de coût intermédiaire. Une seconde personne relit en cherchant explicitement l'erreur, sans avoir participé à la production. L'efficacité tient entièrement à l'instruction donnée : « relis cette note » produit une relecture de forme, « cherche les affirmations que tu ne pourrais pas défendre devant le client » produit une relecture de fond.
  • Le calcul indépendant, le plus coûteux. Pour les sorties chiffrées engageantes, refaire le calcul par un autre chemin. Réservé au niveau 3 et aux montants significatifs, ce dispositif est le seul qui détecte une erreur de transposition sur un raisonnement quantitatif.

Un point de méthode souvent mal compris : faire vérifier une sortie de modèle par un autre modèle n'est pas un dispositif de vérification indépendant. Les deux partagent le même mode de production et le même biais de plausibilité, et le second confirmera fréquemment l'invention du premier. Ce procédé peut servir à repérer des incohérences internes, jamais à établir un fait.

Ce qu'il vaut mieux ne pas confier à un modèle de langage

Certaines tâches sont structurellement mal adaptées, et l'insistance à les confier à un modèle produit des déceptions qui discréditent ensuite les usages pertinents.

Le calcul exact sur un volume de données. Un modèle de langage n'est pas un moteur de calcul. Additionner une colonne, appliquer un taux, rapprocher deux tableaux relève d'un tableur ou d'un programme, qui donneront un résultat exact et reproductible. Un modèle peut en revanche écrire la formule ou le programme qui fera ce calcul, ce qui est un usage tout à fait approprié.

La restitution d'une règle en vigueur. Sur tout sujet normatif, la réponse doit venir du texte, pas du modèle. L'usage pertinent consiste à faire expliquer un texte qu'on lui fournit, jamais à lui demander ce que dit la règle. La nuance paraît subtile ; elle sépare un usage sûr d'un usage dangereux.

La décision elle-même. Un modèle peut lister des options, exposer des arguments, structurer un raisonnement. Lui faire produire la recommandation finale transfère à un procédé statistique un arbitrage qui engage la responsabilité de personnes. C'est la ligne de partage décrite dans copilote IA et contrôle de gestion : l'outil instruit, il ne tranche pas. Au-delà du principe, l'effet observé est un appauvrissement de la délibération : une recommandation formulée avec assurance clôt la discussion au lieu de l'ouvrir.

Le jugement sur les personnes. Évaluation, sélection de candidatures, appréciation individuelle. Le sujet est sensible juridiquement et il l'est devenu davantage avec le cadre européen, qui range plusieurs de ces usages dans les catégories les plus encadrées. Il l'est aussi humainement, et une organisation gagne rarement à confier ce type d'appréciation à un procédé qu'elle ne peut pas expliquer.

Tracer, sans surveiller

La traçabilité est le sujet qui suscite le plus de résistance et celui qui protège le mieux, à condition d'être bien posée. Il ne s'agit pas de conserver les échanges avec le modèle, ce qui serait à la fois intrusif et inutile.

Il s'agit de faire apparaître, sur les documents de niveau 3, deux informations : qu'un outil d'IA a contribué à la production, et qui a vérifié les éléments factuels. Deux lignes en pied de document suffisent. Cette mention protège l'organisation en cas de contestation ultérieure, et elle protège l'auteur en explicitant que la vérification relevait bien d'une personne identifiée.

Elle a un effet secondaire qu'on n'anticipe pas toujours : elle améliore la qualité des vérifications. Signer une vérification n'est pas le même geste que la faire anonymement, et la différence se mesure.

La question de la mention vis-à-vis des clients et partenaires se pose de plus en plus fréquemment, y compris contractuellement dans certains secteurs. Mieux vaut trancher une position claire en amont, quitte à la faire évoluer, que de découvrir la question dans une clause d'appel d'offres.

Mesurer la fiabilité, plutôt que la supposer

Une organisation qui déploie des usages d'IA sans jamais mesurer leur taux d'erreur raisonne sur une impression. Une mesure simple suffit à sortir de là.

Le protocole tient en peu de chose : sur un mois, conserver un échantillon d'une vingtaine de sorties représentatives d'un usage donné, les faire vérifier intégralement par une personne compétente, et compter les énoncés factuels erronés. Le taux obtenu n'a pas vocation à être publié ni comparé ; il sert à calibrer le niveau de vérification exigé sur cet usage précis.

Le résultat conduit presque toujours à une décision plus fine que l'intuition initiale. Certains usages affichent un taux d'erreur si faible qu'un allègement du contrôle est justifié ; d'autres, souvent ceux qui portent sur des informations chiffrées ou normatives, affichent un taux qui justifie de renoncer purement et simplement à l'usage.

Cette démarche de mesure est le prolongement naturel de ce qui est exposé dans la mesure du retour d'un projet IA : un gain de temps qui ne tient pas compte du coût de vérification et du coût des erreurs non détectées n'est pas un gain, c'est une estimation partielle. La fiabilité n'est pas une contrainte qui s'oppose au bénéfice, elle est une composante du calcul de ce bénéfice.

Elle rejoint aussi une exigence plus large de compétence collective : savoir pourquoi un modèle se trompe, reconnaître les situations où il se trompe le plus, et connaître les travaux qui exigent une vérification. Cette compétence s'acquiert en une heure de sensibilisation bien construite et elle constitue, en pratique, la protection la plus efficace dont dispose une organisation.

FAQ

Pourquoi un modèle de langage invente-t-il des informations ?

Parce qu'il optimise la plausibilité de l'énoncé, pas sa véracité. Il produit un texte en choisissant mot après mot la suite la plus vraisemblable au regard de ce qu'il a appris. Dans la plupart des cas, l'énoncé le plus plausible est aussi le plus exact. Quand l'information manque, le procédé ne s'interrompt pas : il continue de produire l'énoncé le plus vraisemblable, qui est alors une invention parfaitement bien formée. C'est même sur les sujets très codifiés que l'erreur est la plus convaincante, une référence juridique inventée respectant scrupuleusement le format attendu.

Peut-on demander à un modèle s'il est sûr de sa réponse ?

Cela n'apporte rien, car la réponse à cette question est produite par le même mécanisme que la réponse initiale : elle est optimisée pour la plausibilité et non pour l'exactitude. Un modèle peut affirmer être certain d'une information inventée avec la même assurance qu'il affirme une information exacte. Faire vérifier une sortie par un autre modèle ne constitue pas davantage un contrôle indépendant : les deux partagent le même biais de plausibilité et le second confirme fréquemment l'invention du premier. Ce procédé repère des incohérences internes, il n'établit pas un fait.

Quels types d'erreur faut-il distinguer ?

Trois, aux remèdes différents. L'énoncé inventé, chiffre ou référence qui n'existe pas, se traite en exigeant une source vérifiable et en la vérifiant. L'énoncé périmé, information autrefois exacte mais modifiée depuis, échappe à toute vérification de plausibilité et se traite par un contrôle de date auprès de la publication d'origine, point critique sur les sujets réglementaires, fiscaux et sociaux. L'énoncé mal transposé, exact dans l'absolu mais inapplicable au cas d'espèce, ne se détecte que par la compétence métier du lecteur, ce qui rend l'usage par un non-spécialiste plus risqué que par un expert.

Comment graduer les exigences de vérification ?

Selon ce que la sortie engage, jamais selon l'outil employé. L'usage exploratoire, où la sortie ne quitte pas son auteur et sera retravaillée, ne demande aucune vérification formelle. L'usage interne diffusé, note ou synthèse qui circule, exige la vérification des seuls énoncés factuels, chiffres et références remontés à leur source. L'usage engageant, tout ce qui sort de l'entreprise ou fonde une décision, exige une vérification intégrale et tracée avec identification de la personne qui l'a effectuée. Une exigence uniforme et maximale est ignorée en quelques semaines parce qu'elle est manifestement disproportionnée sur le premier niveau.

Quelles tâches vaut-il mieux ne pas confier à un modèle de langage ?

Le calcul exact sur des données, qui relève d'un tableur ou d'un programme donnant un résultat reproductible ; un modèle peut en revanche écrire ce programme. La restitution d'une règle en vigueur, qui doit venir du texte : l'usage sûr consiste à faire expliquer un texte qu'on fournit, jamais à demander ce que dit la règle. La décision elle-même, dont la formulation assurée par un modèle clôt la délibération au lieu de l'ouvrir. Enfin le jugement sur les personnes, sensible juridiquement et rangé par le cadre européen parmi les usages les plus encadrés.

Sources
  1. EUR-Lex, règlement (UE) 2024/1689 sur l'intelligence artificielle, obligations graduées selon le risque.
  2. Commission européenne, cadre réglementaire de l'Union en matière d'intelligence artificielle.
  3. CNIL, intelligence artificielle : recommandations et fiches pratiques.
  4. LNE, laboratoire national de métrologie et d'essais, travaux d'évaluation des systèmes d'intelligence artificielle.
  5. ANSSI, publications et recommandations de sécurité applicables aux systèmes d'IA.
  6. Inria, publications de recherche sur l'apprentissage automatique et l'évaluation des modèles.
  7. NIST, AI Risk Management Framework, cadre de gestion des risques liés à l'IA, à lire comme un référentiel de place.
Cet article peut servir à quelqu'un de votre entourage ?

Pour aller plus loin

Portrait de Brice Béchet, consultant en pilotage des organisations
Brice Béchet
Consultant en pilotage des organisations

Contrôleur de gestion sénior, data scientist et créateur d'effectivo.fr, application de prévision stratégique des effectifs (Anticipez. Simulez. Décidez), j'accompagne les organisations à structurer leurs données et optimiser leur pilotage.

Sécuriser vos usages d'IA sans les brider ?

Un cadrage stratégique de deux à trois semaines pour graduer vos exigences de vérification, mesurer le taux d'erreur réel de vos usages et bâtir la sensibilisation. Échangeons sur votre contexte.

Échanger sur mon projet