DONNÉES & FICHIERS

Comment détecter les doublons dans un fichier CSV sans supprimer les mauvaises lignes ?

Repérer une répétition est simple. Décider si elle doit être supprimée demande une méthode plus rigoureuse.

Pour détecter les doublons dans un fichier CSV, commencez par comparer les lignes strictement identiques. Identifiez ensuite une clé métier, normalisez les valeurs et définissez la ligne à conserver. Ne supprimez rien avant d’avoir sauvegardé le fichier original et vérifié la signification de chaque répétition.

Un doublon n’est pas toujours une erreur

Deux lignes identiques peuvent être un défaut d’import, mais aussi deux événements réels enregistrés au même moment. Une liste de contacts, un export de commandes et un journal technique n’utilisent pas les mêmes règles.

Le bon contrôle répond donc à deux questions : quelles lignes se ressemblent, puis quelles lignes représentent réellement le même objet métier ?

Distinguer trois types de doublons

TypeExempleContrôle
Ligne exacteToutes les cellules sont identiquesComparer la ligne complète
Clé identiqueMême e-mail ou numéro de commandeComparer une ou plusieurs colonnes
Quasi-doublonEspaces, casse ou format différentsNormaliser puis valider

Commencez par les doublons exacts : ils sont faciles à expliquer et à vérifier. Passez ensuite aux clés métier et aux quasi-doublons seulement si le besoin le justifie.

1. Conserver une copie intacte

Travaillez toujours sur une copie. La suppression de doublons est une transformation des données et doit rester réversible. Conservez le fichier source, la date de l’opération et la règle appliquée.

2. Choisir la bonne clé métier

Une clé doit identifier l’objet que représente chaque ligne. Un identifiant interne est préférable lorsqu’il existe. À défaut, combinez plusieurs colonnes stables.

  • contacts : adresse e-mail normalisée, éventuellement associée au nom ;
  • commandes : numéro de commande, jamais le seul montant ;
  • produits : référence ou SKU plutôt que libellé ;
  • événements : identifiant et horodatage, selon la granularité attendue.

Une colonne n’est pas une bonne clé simplement parce qu’elle contient peu de répétitions. Elle doit être unique par définition métier.

3. Normaliser avant de comparer

Les valeurs client@example.fr, Client@Example.fr et client@example.fr peuvent désigner la même adresse malgré leurs différences visuelles. Selon le contexte, normalisez :

  • les espaces placés avant ou après les valeurs ;
  • la casse lorsque celle-ci n’a pas de sens métier ;
  • les formats de dates et de numéros ;
  • les séparateurs et caractères invisibles ;
  • les valeurs vides représentées de plusieurs façons.

Gardez cependant la valeur originale dans le fichier de référence. La normalisation sert à comparer, pas à effacer l’information sans contrôle.

4. Définir la ligne à conserver

Une fois les groupes de doublons identifiés, choisissez une règle reproductible : conserver la ligne la plus récente, la plus complète, celle qui possède un statut validé ou celle issue de la source de référence.

Si aucune règle fiable n’existe, marquez les lignes pour revue manuelle au lieu de les supprimer.

5. Vérifier le résultat

Comparez le nombre de lignes avant et après traitement. Contrôlez quelques groupes supprimés, rejouez la détection sur le fichier obtenu et vérifiez que les colonnes, l’encodage et le séparateur sont toujours corrects.

Pour lancer directement le contrôle, ouvrez l’outil Détecter les doublons dans un CSV. Pour une préparation plus large avant import, consultez le guide Nettoyer un fichier CSV avant import. Pour contrôler aussi la structure, utilisez la validation CSV.

Détecter les lignes répétées sans modifier le fichier

DataCheck analyse le CSV de manière statique, signale les lignes strictement dupliquées et présente les autres anomalies à vérifier.

Analyser mon CSV Créer mon espace Protect

Les erreurs fréquentes

  • supprimer toutes les répétitions sans comprendre le fichier ;
  • choisir une colonne non unique comme seule clé ;
  • modifier directement le fichier original ;
  • confondre cellule répétée et ligne dupliquée ;
  • normaliser les données sans conserver leur valeur d’origine ;
  • oublier de vérifier le fichier produit avant son import.

Questions fréquentes

Comment détecter les doublons dans un fichier CSV ?

Repérez d’abord les lignes strictement identiques, puis comparez une clé métier comme un identifiant, un e-mail ou un numéro de commande.

Peut-on supprimer automatiquement toutes les lignes identiques ?

Non. Deux lignes identiques peuvent représenter des événements distincts. Une règle métier est nécessaire avant la suppression.

Quelle colonne utiliser pour chercher les doublons ?

Choisissez une colonne réellement unique ou combinez plusieurs colonnes stables lorsque le fichier ne possède pas d’identifiant fiable.

Quelle différence entre doublon exact et quasi-doublon ?

Un doublon exact répète les mêmes valeurs. Un quasi-doublon contient des variations qui nécessitent une normalisation et une validation.

Détecter d’abord, décider ensuite

La détection technique produit des candidats. La décision de fusionner ou supprimer dépend du sens des données. Une méthode sûre conserve la source, documente la clé et vérifie le résultat avant tout import.

Publié le 20 août 2026.