Analyse de Données & Business Intelligence (SQL, Python, Power BI)
Module 1 · Module 1 — Comprendre la donnée · Leçon 1 sur 1
Comprendre la donnée
Avant d'ouvrir le moindre logiciel d'analyse, il faut comprendre une vérité simple mais souvent ignorée : une analyse n'est jamais meilleure que la donnée sur laquelle elle repose. On appelle ça, en anglais, le principe « garbage in, garbage out » — littéralement, des ordures en entrée, des ordures en sortie. Si la donnée de départ est fausse, incomplète ou mal comprise, aucun graphique élégant ni aucun tableau de bord sophistiqué ne pourra corriger le problème. Commençons par les types de données. Une donnée peut être numérique — un montant de vente, un âge, une quantité — ou catégorielle, c'est-à-dire représentant une catégorie parmi un nombre limité de possibilités, comme une région ou un statut de commande. Elle peut aussi être une date, ou du texte libre. Cette distinction n'est pas un détail technique : elle détermine directement les opérations qu'on peut faire. On peut calculer une moyenne sur un montant numérique ; ça n'a aucun sens sur une catégorie comme « Nord » ou « Sud ». Parlons ensuite des sources de données. Dans une entreprise réelle, la donnée vient rarement d'un seul endroit propre et centralisé. Elle provient souvent d'un mélange : un export de logiciel de caisse, un tableau Excel tenu manuellement par une équipe commerciale, une base de données de gestion client, parfois même une saisie papier numérisée après coup. Chaque source a ses propres conventions, ses propres erreurs typiques, et souvent son propre format de date ou de nombre. Savoir d'où vient une donnée, avant de l'analyser, permet d'anticiper ses défauts probables. Vient enfin la question centrale de ce module : la qualité de la donnée. Quatre problèmes reviennent presque systématiquement dans un jeu de données réel. Premièrement, les valeurs manquantes — une case vide là où une information était attendue. Deuxièmement, les doublons — la même transaction ou le même client enregistré deux fois, souvent avec de petites variations d'orthographe qui empêchent une détection automatique simple. Troisièmement, les incohérences de format — une date écrite tantôt jour-mois-année, tantôt année-mois-jour, dans le même fichier. Quatrièmement, les valeurs aberrantes — un montant de vente à dix millions de francs CFA dans un jeu de données où la transaction moyenne tourne autour de vingt mille francs, qui peut être une vraie vente exceptionnelle ou une erreur de saisie évidente. La compétence la plus importante de ce module n'est donc pas un outil, c'est un réflexe : avant toute analyse, faire systématiquement un audit rapide de la qualité des données. Compter les valeurs manquantes par colonne, chercher les doublons évidents, vérifier la cohérence des formats, et repérer les valeurs extrêmes qui méritent une vérification. Cet audit prend rarement plus de trente minutes sur un jeu de données de taille moyenne, et il évite des heures perdues à analyser une donnée qu'il aurait fallu nettoyer d'abord.
Aperçu gratuit, sans compte — la suite de ce module et les modules suivants s'ouvrent après inscription.
Convaincu·e ? Inscris-toi pour débloquer la formation complète.
Voir les tarifs