La règle la plus importante est de ne jamais modifier l’unique copie du fichier source. Travaillez sur une copie et produisez un fichier de sortie distinct.
1. Profiler avant de transformer
Relevez l’encodage, le séparateur, le nombre de lignes et de colonnes, les en-têtes, les valeurs manquantes et les types observés. Cette photographie permettra de vérifier que le nettoyage n’a pas supprimé des données inattendues.
2. Écrire un contrat minimal
| Colonne | Type | Obligatoire | Règle |
|---|---|---|---|
| customer_id | texte | oui | unique, non vide |
| created_at | date | oui | format ISO 8601 |
| amount | décimal | non | point décimal, valeur positive |
3. Normaliser avec prudence
- supprimer les espaces périphériques sans altérer le contenu significatif ;
- uniformiser les dates vers un format non ambigu ;
- préserver les zéros initiaux des identifiants ;
- définir une représentation unique pour les valeurs manquantes ;
- ne pas convertir automatiquement un texte en nombre sans contrat.
4. Traiter les doublons
Commencez par les lignes strictement identiques, puis appliquez la clé métier. Conservez un journal indiquant la règle et le nombre de lignes retirées. Les quasi-doublons doivent faire l’objet d’une revue distincte.
5. Valider le fichier de sortie
Recomptez les lignes, contrôlez les valeurs rejetées, vérifiez les colonnes obligatoires et ouvrez un échantillon avec le système cible. Le nettoyage n’est terminé que lorsque les écarts sont expliqués.
Premier diagnostic
DataCheck relève structure, valeurs manquantes, doublons, types mélangés et cellules à risque.
Analyser le CSVVoir aussi valider un fichier CSV et détecter les doublons.
Publié le 19 juillet 2026.