Supprimer les Lignes Dupliquées
Supprime les lignes répétées de votre texte tout en préservant l'ordre original.
Comment utiliser Supprimer les Lignes Dupliquées
- 1
Collez votre texte
Saisissez ou collez les lignes à nettoyer dans la zone de saisie.
- 2
Définissez les options
Activez Sensible à la casse et Supprimer les espaces superflus pour contrôler la façon dont les lignes sont comparées pour détecter les doublons.
- 3
Supprimez les doublons
Cliquez sur Supprimer les doublons pour retirer les lignes répétées tout en conservant la première occurrence de chacune.
- 4
Copiez le résultat
Utilisez le bouton de copie sur la sortie pour enregistrer votre texte dédupliqué.
Dédupliquer les lignes sans perdre l’ordre d’origine
Garder la première occurrence, supprimer les suivantes
Cet outil supprime les lignes répétées tout en conservant la première apparition de chaque ligne. À mesure qu’il parcourt le texte de haut en bas, il mémorise chaque ligne déjà rencontrée ; dès qu’une ligne réapparaît, cette copie ultérieure est écartée. La ligne conservée demeure toujours à sa position d’origine : l’enchaînement général de votre texte est ainsi préservé à l’identique.
Un exemple permet d’y voir clair. Pour les lignes apple, banana, apple, cherry, banana, le résultat est apple, banana, cherry. Le second apple et le second banana sont supprimés, mais l’ordre des premières occurrences reste inchangé.
Dédupliquer sans trier
Beaucoup de gens se tournent vers un tableur ou une commande de tri en ligne de commande pour supprimer les doublons, mais le tri bouleverse l’ordre au passage. C’est acceptable pour une liste classée par ordre alphabétique, mais désastreux dès que la séquence a du sens : un journal chronologique, un classement ou les étapes d’un processus. Cet outil préserve l’ordre justement parce qu’il ne trie jamais.
Si vous souhaitez réellement une liste à la fois triée et sans doublons, triez le résultat dans un second temps. Dissocier les deux opérations vous laisse le contrôle : dédupliquez d’abord pour conserver l’ordre, ou triez d’abord si l’ordre vous importe peu.
La sensibilité à la casse, activée ou non
Par défaut, la comparaison est sensible à la casse : Apple et apple sont donc considérées comme des lignes différentes et toutes deux conservées. Désactivez l’option Sensible à la casse et l’outil les traite comme une seule et même ligne, ne gardant que la première. Cela se révèle utile en permanence avec des données réelles, où une même valeur apparaît dans des casses variées.
Optez pour une comparaison insensible à la casse lorsque vous dédupliquez des éléments comme des adresses e-mail, des étiquettes ou des noms d’utilisateur, où '[email protected]' et '[email protected]' doivent à l’évidence compter pour un seul. Conservez la sensibilité à la casse lorsque la capitalisation a un sens, par exemple pour distinguer des identifiants de code.
Supprimer les espaces avant de comparer
L’option Supprimer les espaces ignore les espaces et tabulations en début et en fin de ligne au moment de déterminer si deux lignes correspondent. Sans elle, une ligne se terminant par un espace final invisible est techniquement différente de la même ligne sans cet espace, et toutes deux subsisteraient. Avec elle, ces lignes quasi identiques fusionnent en une seule entrée.
C’est ce qui explique la raison la plus courante pour laquelle la suppression des doublons semble « rater » des répétitions pourtant évidentes : les espaces invisibles. Activer cette option est généralement le bon choix lorsque vos données ont été assemblées à partir de plusieurs sources collées.
Combiner les deux options
Toute la puissance de l’outil se révèle lorsqu’on active les deux options ensemble. Désactivez la sensibilité à la casse et activez la suppression des espaces : l’outil traitera alors ' Apple ', 'apple' et 'APPLE' comme une seule et même valeur. C’est le réglage le plus tolérant, et celui qui produit généralement la liste dédupliquée la plus propre à partir d’une entrée désordonnée.
À l’inverse, si vous avez besoin d’une déduplication stricte, à correspondance exacte, laissez la sensibilité à la casse activée et la suppression des espaces désactivée. La ligne doit alors être identique octet pour octet, espaces compris, pour être supprimée.
Là où il fait ses preuves
Parmi les tâches typiques : nettoyer une liste de diffusion pour que chaque adresse n’apparaisse qu’une seule fois, condenser des fichiers journaux où la même erreur se répète des centaines de fois, fusionner plusieurs listes en une seule liste maîtresse sans doublons, ou encore mettre de l’ordre dans des données exportées avant de les importer. Partout où vous disposez de valeurs réparties une par ligne et susceptibles de se recouper, cet outil les ramène à un ensemble unique.
Comme chaque entrée est évaluée en tant que ligne entière, il excelle sur les listes de valeurs courtes, à raison d’un élément par ligne, plutôt que sur du texte rédigé où la notion de « doublon » n’a guère de sens.
Des lignes, pas des mots ni des phrases
Il est important de garder à l’esprit que l’unité de comparaison est la ligne entière. Deux lignes qui partagent un mot répété mais diffèrent par ailleurs sont toutes deux conservées, car en tant que lignes complètes elles ne sont pas identiques. Cet outil ne repère pas les mots ou les phrases répétés à l’intérieur d’un paragraphe ; il travaille strictement sur des lignes entières.
Si vos doublons ne figurent pas encore chacun sur leur propre ligne, séparez-les d’abord, par exemple avec l’outil Ajouter des Sauts de Ligne réglé pour insérer un saut après chaque virgule, afin que chaque valeur se retrouve sur une ligne distincte, puis lancez la déduplication.
Questions fréquentes
Conserve-t-il l'ordre original des lignes ?
La comparaison est-elle sensible à la casse ?
À quoi sert l'option Supprimer les espaces superflus ?
Quelle copie d'une ligne en double est conservée ?
Mon texte est-il envoyé à un serveur ?
Outils similaires
Continuez avec ces outils pratiques