QUALITÉ DES DONNÉES

Nettoyer un fichier CSV avant import

Traitez les anomalies dans un ordre reproductible et conservez la trace de chaque transformation.

La règle la plus importante est de ne jamais modifier l’unique copie du fichier source. Travaillez sur une copie et produisez un fichier de sortie distinct.

1. Profiler avant de transformer

Relevez l’encodage, le séparateur, le nombre de lignes et de colonnes, les en-têtes, les valeurs manquantes et les types observés. Cette photographie permettra de vérifier que le nettoyage n’a pas supprimé des données inattendues.

2. Écrire un contrat minimal

ColonneTypeObligatoireRègle
customer_idtexteouiunique, non vide
created_atdateouiformat ISO 8601
amountdécimalnonpoint décimal, valeur positive

3. Normaliser avec prudence

  • supprimer les espaces périphériques sans altérer le contenu significatif ;
  • uniformiser les dates vers un format non ambigu ;
  • préserver les zéros initiaux des identifiants ;
  • définir une représentation unique pour les valeurs manquantes ;
  • ne pas convertir automatiquement un texte en nombre sans contrat.

4. Traiter les doublons

Commencez par les lignes strictement identiques, puis appliquez la clé métier. Conservez un journal indiquant la règle et le nombre de lignes retirées. Les quasi-doublons doivent faire l’objet d’une revue distincte.

5. Valider le fichier de sortie

Recomptez les lignes, contrôlez les valeurs rejetées, vérifiez les colonnes obligatoires et ouvrez un échantillon avec le système cible. Le nettoyage n’est terminé que lorsque les écarts sont expliqués.

Premier diagnostic

DataCheck relève structure, valeurs manquantes, doublons, types mélangés et cellules à risque.

Analyser le CSV

Voir aussi valider un fichier CSV et détecter les doublons.

Publié le 19 juillet 2026.