La qualité d'une donnée se juge par rapport à l'usage auquel elle est destinée : suffisamment fiable, comprise et à jour pour lui.
Définir l'usage avant la qualité
Un même défaut n'a pas la même importance selon la décision. Une adresse manquante peut être secondaire pour un indicateur financier et bloquante pour une livraison. Le point de départ est donc les données utilisées dans les processus et indicateurs prioritaires ; le niveau de qualité attendu se définit à partir de leurs conséquences, pas dans l'absolu.
La complétude, l'unicité, l'exactitude, la validité, la cohérence, la fiabilité et l'actualité sont les critères les plus couramment retenus pour juger une donnée. Ces critères n'ont pas le même poids pour chaque décision : une donnée peut être suffisamment précise pour un suivi mensuel et insuffisante pour une facturation ou une décision individuelle. Pour un indicateur critique, il faut savoir quelle anomalie rendrait le chiffre inutilisable, quel seuil est acceptable et qui corrige ; pour un rapprochement entre deux systèmes, l'unicité et la cohérence des identifiants deviennent prioritaires. Cette approche évite de lancer un programme abstrait de « qualité » sans priorité.
Vérifier la complétude
La complétude mesure la présence des informations nécessaires. Il faut distinguer un champ réellement obligatoire d'un champ simplement disponible dans l'application.
Le contrôle doit porter sur la population concernée et permettre d'identifier où les valeurs manquent.
Vérifier l'exactitude
Pour les données personnelles, l'article 5 du RGPD impose que des données inexactes soient rectifiées ou effacées sans tarder, et que toutes les mesures raisonnables soient prises en ce sens. Plus largement, l'exactitude demande une référence ou un contrôle permettant de détecter les valeurs erronées.
Toutes les données ne peuvent pas être vérifiées individuellement. Des contrôles de cohérence et des rapprochements peuvent compléter la validation, ce qui compte particulièrement lorsque ces données alimentent ensuite un modèle, comme le développe de l'analyse descriptive à la prédiction : un modèle construit sur des données inexactes produit des résultats inexacts, plus vite.
Vérifier la fraîcheur et la cohérence
Une donnée exacte mais trop ancienne peut être inutilisable. La fraîcheur attendue dépend du processus. Il faut aussi vérifier que deux systèmes censés représenter le même objet ne produisent pas durablement des valeurs différentes.
Ces écarts sont souvent plus instructifs que le calcul d'un score global de qualité, et ils minent la confiance dans un tableau de bord bien avant que sa lecture ne pose problème : voir data storytelling : faire lire vos tableaux de bord.
Documenter les définitions
Une grande partie des désaccords vient de définitions différentes plutôt que de valeurs fausses : périmètre, date d'effet, unité et règle de calcul. Qui définit et documente ces règles, et qui porte la responsabilité d'un contrôle, relève de la gouvernance des données, développée dans gouvernance des données dans une ETI.
Traiter la cause plutôt que corriger le tableau final
Lorsqu'une anomalie est détectée dans un reporting, la correction locale peut rétablir le chiffre du mois mais laisser la cause intacte. Il faut remonter à la source : saisie, référentiel, transformation, interface ou règle métier. La correction durable se situe à l'endroit où l'erreur apparaît, pas dans le tableau final.
Un journal d'anomalies peut suffire pour commencer : type, impact, origine, responsable et statut. Il permet de distinguer une correction ponctuelle d'un problème structurel, une valeur manquante réparée dans un fichier n'est pas la même chose qu'une valeur qui manque chaque mois pour la même raison, et il aide à identifier les quelques causes qui produisent le plus de reprises. C'est souvent un meilleur point de départ qu'un indicateur global de qualité, et cela évite que les équipes de reporting corrigent indéfiniment en aval des problèmes qui devraient être résolus à la source. Au-delà des contrôles, la qualité durable des données tient aussi à une acculturation partagée sur ce qu'elles représentent, ce que développe culture data et acculturation. Lorsque le doute porte sur l'ensemble du dispositif, un Diagnostic du pilotage peut servir de point de départ.
Questions fréquentes
Comment savoir si une donnée est suffisamment fiable ?
Cela dépend de l'usage : une donnée suffisamment fiable pour un suivi mensuel peut ne pas l'être pour une facturation ou une décision individuelle. La question n'a pas de réponse absolue.
Faut-il viser 100% de complétude ?
Rarement utile en soi : mieux vaut distinguer les champs réellement nécessaires à une décision de ceux qui sont simplement disponibles, et concentrer l'effort sur les premiers.
Qui doit corriger une anomalie de données ?
La personne la plus proche de la source qui produit l'erreur, pas nécessairement celle qui la constate dans un reporting : corriger en aval laisse la cause intacte.
Comment prioriser les contrôles de qualité ?
À partir des décisions qu'un défaut pourrait fausser, pas à partir d'un score global de qualité abstrait.
Un score de qualité des données est-il utile ?
Moins qu'un journal d'anomalies ventilé par source et par type, qui montre où concentrer l'effort : un score agrégé masque souvent d'où viennent les vrais problèmes.
Pour aller plus loin
De l'analyse descriptive à la prédiction
Comment passer du constat à l'anticipation. Les étapes concrètes pour intégrer la data science prédictive dans le pilotage d'une organisation.
ArticleGouvernance des données en entreprise : responsabilités, règles et contrôles
Nommer les responsabilités, documenter les définitions, organiser la qualité et gérer les changements de règles pour mettre en place une gouvernance des données.
Un doute sur la fiabilité de vos données ?
Un diagnostic pilotage permet d'évaluer la qualité de vos données prioritaires et de poser un plan de correction ciblé sur les vraies causes. Échangeons sur votre contexte.
Échanger sur mon projet