Mise en œuvre d'un processus de qualité des données

Rendre transparents l'exécution, les responsabilités et le comportement en exécution

Table des matières

Qualité des données et gestion de la qualité des données (DQM) : dimensions, gestion et outils adaptés

La qualité des données constitue l'un des principaux défis pour toute organisation, que ce soit en matière de prise de décision, de gestion financière ou de performance au quotidien. Des données de mauvaise qualité ont un coût élevé : selon une étude publiée par la revue « MIT Sloan Management Review », négliger la qualité des données peut coûter à une entreprise entre 15 % et 25 % de son chiffre d'affaires.

Ces pertes se traduisent non seulement par des occasions manquées liées à de mauvaises décisions ou à une réputation entachée, mais aussi par des sanctions réglementaires et par le temps consacré à rechercher, nettoyer et corriger des données erronées. Le risque est à la fois opérationnel, financier, juridique et stratégique.

À l'inverse, des données de haute qualité permettent aux organisations d'améliorer leurs performances opérationnelles, de satisfaire leurs clients et de rester plus compétitives — car une entreprise qui a confiance en ses données peut réorienter sa stratégie rapidement et en toute confiance.

Qu'est-ce qui fait qu'une donnée est « de bonne qualité » ? Les dimensions de la qualité des données

Voici une vérité dérangeante : une donnée n’a aucune qualité intrinsèque. On ne peut l’évaluer qu’une fois que l’on sait ce que l’on compte en faire. Quel est l’objectif final ? Comment sera-t-elle traitée ? Que signifie réellement cette information ? Quelles sont les attentes en matière de qualité, et pourquoi ? En d’autres termes, la qualité est définie par l’usage que souhaitent en faire ceux qui s’appuient sur ces données : les équipes informatiques, les équipes métier et la direction.

Cela nécessite donc à la fois une compréhension globale et détaillée des processus métier mis en œuvre dans l'ensemble de l'organisation, ainsi que des normes qui régissent les échanges de données en interne et avec des tiers.

La réglementation fixe également des limites strictes. Des cadres réglementaires tels que le RGPD imposent des contraintes quant à la manière dont les données à caractère personnel peuvent être traitées tout au long de leur cycle de vie. Une donnée stockée ou utilisée en dehors de ces limites légales ne peut être considérée comme étant de haute qualité, aussi utile soit-elle par ailleurs. (C'est précisément pour garantir le maintien des données dans ces limites que la souveraineté des données a été conçue.)

Une fois ces conditions réunies, la qualité des données peut être évaluée à l'aune de différents critères: exactitude, exhaustivité, conformité, intégrité, cohérence, disponibilité, actualité, intelligibilité, comparabilité, etc. Les critères liés au niveau de service sont également importants : il s'agit notamment de déterminer dans quelle mesure les données sont compréhensibles, accessibles et à jour au moment de leur utilisation.

Mettez en place une base de données fiable pour permettre une automatisation pilotée par l'IA et une prise de décision sûre. Téléchargez le livre blanc pour découvrir comment faire de la gouvernance des données une capacité stratégique — et tirer pleinement parti de l'automatisation évolutive et de l'IA.

Pourquoi et comment mettre en place une gestion de la qualité des données (DQM)

Une initiative en matière de qualité des données ne se résume pas simplement à charger des enregistrements corrects dans vos systèmes. Elle implique également de supprimer les données erronées, corrompues ou en double, et de décrire vos données avec précision — par le biais d’un dictionnaire de données, par exemple — afin qu’elles puissent réellement être exploitées. Si vous souhaitez avoir une vision opérationnelle de cette démarche de bout en bout, nous vous la présentons en détail dans notre guide sur la mise en œuvre d’un processus de qualité des données.

Tout d'abord, comment mesure-t-on la qualité de ses données ?

La première étape consiste à dresser un inventaire de l’ensemble de votre parc de données, puis à le classer et à identifier chaque ensemble de données en fonction de son utilisation. Ce n’est qu’alors que vous pourrez analyser la qualité tout au long du cycle de vie des données, en fonction des dimensions que vous avez jugées prioritaires dans votre contexte et de vos règles métier. La cartographie et le catalogage de vos données constituent donc le fondement de tout cet exercice: vous ne pouvez pas mesurer la qualité d’un parc que vous n’avez jamais inventorié. Établir cet inventaire est précisément l’objectif du défi « Data Catalog ».

Les erreurs peuvent être d'ordre technique, mais elles sont bien plus souvent d'origine humaine ou organisationnelle, et elles se glissent à différentes étapes du cycle de vie et à différents niveaux du système d'information :

  • Au moment de la collecte — en raison d'une erreur de saisie, intentionnelle ou non.
  • Lors du partage — lorsque plusieurs versions d'un même enregistrement commencent à circuler.
  • Lors de l'exportation — en raison de règles mal définies en amont ou d'un problème de compatibilité.
  • En cours de maintenance — en raison d'un encodage défectueux.

Une « mauvaise qualité » se traduit par des données inexactes, obsolètes, non conformes — ou tout simplement inutilisées. Une donnée peut être parfaitement correcte tout en étant de mauvaise qualité si personne ne s'en sert plus et qu'elle n'apporte plus aucune valeur ajoutée.

Les contrôles de qualité tout au long du cycle de vie des données sont essentiels. Si une donnée est de mauvaise qualité à la source, elle le restera jusqu’à la fin : c’est le principe « garbage in, garbage out » (si l’on entre des données erronées, on obtient des résultats erronés). Pour garantir la mise en œuvre d’une stratégie de qualité des données, il est judicieux d’organiser des ateliers avec les services métier et d’intégrer des règles de qualité directement dans les applications que les utilisateurs manipulent au quotidien.

— Projet de citation, attribution en attente de validation (responsable de la gouvernance des données chez SoftProject)

L'approche de gestion de la qualité des données

La gestion de la qualité des données (DQM) est la discipline qui vise à fournir des données fiables répondant aux besoins métier et techniques de leurs utilisateurs. Elle englobe l'ensemble des processus, outils, méthodes de gouvernance et politiques internes mis en place pour garantir la qualité tout au long du cycle de vie des données — et, à terme, pour transformer des données de qualité en informations exploitables.

Un programme d'amélioration continue (tel que le TDQM) peut s'appuyer sur les quatre phases du cycle de Deming : planifier, faire, vérifier, agir. Plus concrètement, une fois la cartographie initiale réalisée, six étapes se répètent :

  1. Profilage des données — analyse des structures des tables, des relations entre les tables, de la pertinence des données et de la validité des formats.
  2. Nettoyage des données — identification des données de mauvaise qualité et correction à la source (suppression des doublons, complétion des valeurs manquantes). Il s'agit d'un processus itératif par nature.
  3. Normalisation — harmonisation des données sous un format commun permettant l'interopérabilité et une compréhension partagée par tous. Il s'agit là des mêmes bases qui permettent la circulation des données entre les systèmes dans le cadre du défi « Interopérabilité et flux de données ».
  4. Déduplication: suppression des doublons au sein d'un même fichier et identification des enregistrements présents dans plusieurs fichiers de l'entreprise, afin qu'une seule version soit conservée.
  5. Enrichissement — amélioration de l'exhaustivité des données corrigées et validées en fonction de leur utilisation future. Il s'agit également d'un processus continu.
  6. Rapports et suivi — suivi de l'évolution de la qualité au fil du temps à l'aide de tableaux de bord et d'indicateurs clés de performance (KPI).

Pour mener à bien un programme de qualité des données, une campagne de sensibilisation en amont — soutenue par la direction — fait toute la différence. Mettez en place un plan de communication adapté, comprenant des formations et des supports clairs et captivants, afin que vos collègues comprennent les enjeux et adoptent les bonnes pratiques.

— Projet de citation, attribution en attente de validation (responsable de la gouvernance des données chez SoftProject)

La place des métadonnées dans votre stratégie de qualité des données

La qualité des données ne peut plus être envisagée indépendamment de la qualité des métadonnées qui les décrivent. Les métadonnées apportent le contexte, la traçabilité et l’interprétabilité dont vous avez besoin pour exploiter les données dans des scénarios avancés : intelligence artificielle, gouvernance réglementaire, collaboration inter-équipes. Sans métadonnées fiables, riches et normalisées, les données deviennent difficiles à réutiliser, faciles à mal interpréter et sujettes à des biais. Grâce à elles, les informations restent accessibles, les modèles d’IA s’entraînent plus rapidement et s’expliquent mieux, et les équipes techniques et métier parlent le même langage. C’est précisément pour cette raison que la gestion des métadonnées est au cœur de la couche de gouvernance des données de SoftProject.

Dans la pratique, il est difficile de faire abstraction de l’IA — et celle-ci est très exigeante en matière de données de qualité. Une donnée « prête pour l’IA » est une donnée de haute qualité associée à des métadonnées de haute qualité, comme le souligne une étude de la Banque mondiale sur les données prêtes pour l’IA. Exclure les métadonnées d’un programme de qualité des données n’est plus une option défendable.

Des données pour l'IA → L'IA au service des données : la boucle vertueuse

Une approche moderne de la qualité des données est circulaire. Des données et des métadonnées fiables et bien structurées permettent de développer des modèles d’IA hautement performants (les données au service de l’IA). Une fois entraînés, ces modèles peuvent à leur tour favoriser l’amélioration continue de la qualité des données et des métadonnées: en détectant automatiquement les erreurs, en signalant les doublons et en enrichissant les descriptions (l’IA au service des données). Les données alimentent l’IA ; en retour, l’IA renforce la fiabilité, la clarté et la valeur des données.

Un programme de qualité des données ne peut pas voir le jour sans gestion des métadonnées. Ce sont les métadonnées qui fournissent le contexte permettant de comprendre une donnée. Depuis l'essor fulgurant de l'IA générative, nous avons tous pris conscience de l'importance du contexte lorsqu'on souhaite obtenir des réponses pertinentes.

— Devis PRÉLIMINAIRE, mention de l'auteur en attente de validation (SoftProject Innovation).

Quels outils et quelles fonctions permettent d'améliorer la qualité de vos données de référence ?

Les personnes qui veillent à la qualité des données

Plusieurs fonctions ont vu le jour à mesure que les organisations accordaient davantage d'importance à la qualité des données et à la maîtrise de leurs données de référence. Le « Master Data Manager », généralement associé à une solution MDM ; le « Data Steward », qui facilite l'accès aux données pour les services opérationnels ; le « Data Owner », qui est responsable de la qualité finale des données. Les dirigeants tels que le CDO (Chief Data Officer) sont généralement les premiers promoteurs de ces transformations.

Une équipe pluridisciplinaire — responsable de la qualité des données, architecte de données, data scientists, gestionnaire de données, délégué à la protection des données — est indispensable pour mener à bien ce travail. Mais ne vous limitez pas aux personnes : le choix des bons outils est tout aussi important.

La qualité des données est un enjeu transversal : elle ne peut pas relever de la seule responsabilité des équipes chargées des données ou de l'informatique. Il faut impliquer à nouveau les services métier et leur apporter un soutien directement au sein de leurs propres applications, afin qu'ils puissent vérifier et valider la cohérence de leurs données. Les outils nécessaires à cela existent désormais.

— Projet de citation, attribution en attente de validation (responsable de la gouvernance des données chez SoftProject)

Une boîte à outils couvrant plusieurs domaines fonctionnels

Pour garantir une qualité optimale des données, il faut disposer des bons outils — mais nous vous conseillons de prendre un peu de recul et d’examiner d’abord vos besoins ainsi que le périmètre fonctionnel de chaque étape, plutôt que de vous précipiter directement sur les « outils et acronymes ». Les principaux domaines fonctionnels de la qualité des données se présentent comme suit :

  • Analyse de la qualité des données (DQ)
  • Sécurité des données
  • Conformité
  • Suivi et analyse
  • Découverte des données
  • Catalogue de données (métadonnées)
  • Traçabilité des données
  • Gestion des données de base et des données de référence (MDM)
  • Transformation et transfert de données (ETL, ELT, ESB)
  • Partage et exposition des données (gestion des API)
  • Visualisation et reporting (business intelligence)

Le défi « Choisir votre plateforme de données » repose sur l'idée de regrouper ces domaines sous un même toit, plutôt que de simplement assembler des outils ponctuels.

Notre conviction : associer les perspectives « données » et « processus » au service de la qualité des données

Chez SoftProject, nous sommes convaincus que les données et les processus sont indissociables. C'est pourquoi la gestion des processus métier sur la plateforme SoftProject — optimisée par X4 BPMS et orchestrée de bout en bout avec Phoenix — vous permet de comprendre vos processus métier et les utilisations des données qui y sont associées.

Pour gérer vos données de référence — clients, fournisseurs, produits, données financières —, les fonctionnalités de gestion des données de référence (Master Data Management) et de gouvernance des données de la plateforme, associées à MyDataCatalogue et dataspot., vous permettent de superviser et d’automatiser l’ensemble des opérations liées à vos données : les collecter, les transférer, les enrichir, les diffuser. Vous pouvez modéliser vos données de référence, créer vos propres indicateurs et garantir la pertinence, l’unicité et la traçabilité des informations tout au long de leur cycle de vie — le tout sur une seule et même plateforme.

Vous souhaitez évaluer vos propres défis en matière de qualité des données avec un expert de SoftProject ?

Édouard Cante, directeur des produits chez SoftProject GmbH

En tant que directeur des produits, Édouard Cante est chargé de l'orientation stratégique et du développement du portefeuille de produits de SoftProject. Fort d'une excellente connaissance du marché et d'un esprit d'innovation très marqué, il promeut des solutions centrées sur le client et veille à la compétitivité à long terme de l'entreprise.

Partager :
Articles recommandés