डुप्लिकेट पंक्तियाँ हटाएँ
मूल क्रम बनाए रखते हुए आपके टेक्स्ट से दोहरी पंक्तियों को हटाता है।
डुप्लिकेट पंक्तियाँ हटाएँ का उपयोग कैसे करें
- 1
अपना टेक्स्ट पेस्ट करें
जिन लाइनों को आप साफ़ करना चाहते हैं उन्हें इनपुट बॉक्स में दर्ज करें या पेस्ट करें।
- 2
विकल्प सेट करें
डुप्लिकेट के लिए लाइनों की तुलना कैसे की जाए यह नियंत्रित करने हेतु Case Sensitive और Trim Whitespace टॉगल करें।
- 3
डुप्लिकेट हटाएँ
हर लाइन की पहली उपस्थिति रखते हुए दोहराई गई लाइनें हटाने के लिए Remove Duplicates पर क्लिक करें।
- 4
नतीजा कॉपी करें
अपना डुप्लिकेट-मुक्त टेक्स्ट सहेजने के लिए आउटपुट पर मौजूद कॉपी बटन का इस्तेमाल करें।
क्रम खोए बिना पंक्तियाँ डीडुप्लिकेट करना
पहली रखें, बाकी हटाएँ
यह टूल दोहराई गई पंक्तियाँ हटा देता है पर हर पंक्ति के पहली बार आने को बनाए रखता है। जैसे-जैसे यह ऊपर से नीचे पढ़ता है, यह हर उस पंक्ति को याद रखता है जिसे यह पहले देख चुका है; जब कोई पंक्ति फिर से आती है, तो वह बाद वाली प्रति हटा दी जाती है। बची हुई प्रति हमेशा अपनी मूल जगह पर बैठी रहती है, इसलिए आपके टेक्स्ट का समग्र अनुक्रम बिल्कुल बरकरार रहता है।
एक उदाहरण इसे स्पष्ट कर देता है। apple, banana, apple, cherry, banana पंक्तियाँ दिए जाने पर, आउटपुट apple, banana, cherry होता है। दूसरा apple और दूसरा banana हटा दिए जाते हैं, पर पहली उपस्थितियों का क्रम अछूता रहता है।
बिना सॉर्ट किए डीडुप्लिकेट करना
बहुत से लोग डुप्लिकेट हटाने के लिए किसी स्प्रेडशीट या कमांड-लाइन sort की ओर बढ़ते हैं, पर सॉर्टिंग एक दुष्प्रभाव के रूप में आपके क्रम को उलट-पुलट कर देती है। यह किसी वर्णानुक्रमित सूची के लिए तो ठीक है पर ऐसी हर चीज़ के लिए विनाशकारी है जहाँ अनुक्रम मायने रखता है, जैसे कोई कालक्रमिक लॉग, कोई रैंक की गई सूची, या किसी प्रक्रिया के चरण। यह टूल क्रम को ठीक इसलिए बनाए रखता है क्योंकि यह कभी सॉर्ट नहीं करता।
अगर आप वाकई एक सॉर्ट की गई, अद्वितीय सूची चाहते हैं, तो आउटपुट को बाद में सॉर्ट कर लें। दोनों क्रियाओं को अलग-अलग करना आपको नियंत्रण देता है: क्रम बनाए रखने के लिए पहले डीडुप्लिकेट करें, या अगर क्रम आपके लिए मायने नहीं रखता तो पहले सॉर्ट करें।
केस संवेदनशीलता, चालू या बंद
डिफ़ॉल्ट रूप से तुलना case sensitive होती है, इसलिए Apple और apple अलग-अलग पंक्तियाँ मानी जाती हैं और दोनों रखी जाती हैं। Case Sensitive बंद करें और टूल उन्हें एक ही पंक्ति मानता है, केवल पहली को रखते हुए। यह असल-दुनिया के डेटा के साथ लगातार मायने रखता है जहाँ एक ही मान मिश्रित कैपिटलाइज़ेशन में आता है।
जब आप ईमेल पते, टैग, या उपयोगकर्ता नाम जैसी चीज़ें डीडुप्लिकेट कर रहे हों तब case-insensitive मैचिंग का इस्तेमाल करें, जहाँ '[email protected]' और '[email protected]' को साफ़ तौर पर एक ही गिना जाना चाहिए। जब कैपिटलाइज़ेशन सार्थक हो, जैसे कोड पहचानकर्ताओं में अंतर करना, तब इसे case sensitive रखें।
तुलना से पहले व्हाइटस्पेस छाँटना
Trim Whitespace विकल्प यह तय करते समय कि दो पंक्तियाँ मैच करती हैं या नहीं, शुरुआती और अंतिम स्पेस तथा टैब को नज़रअंदाज़ कर देता है। इसके बिना, ऐसी पंक्ति जो किसी अदृश्य अंतिम स्पेस के साथ खत्म होती है, तकनीकी रूप से उसी पंक्ति से अलग होती है जिसमें वह न हो, और दोनों बच जातीं। इसके साथ, वे लगभग-समान पंक्तियाँ एक ही प्रविष्टि में समा जाती हैं।
यह उस सबसे आम कारण को पकड़ लेता है जिसकी वजह से डुप्लिकेट हटाना ज़ाहिर दोहरावों को 'चूकता' लगता है: अदृश्य व्हाइटस्पेस। जब आपका डेटा कई पेस्ट किए स्रोतों से इकट्ठा किया गया हो, तब trim चालू करना आम तौर पर सही फ़ैसला होता है।
दोनों विकल्पों को मिलाना
असली ताकत दोनों टॉगल को एक साथ इस्तेमाल करने से आती है। केस संवेदनशीलता बंद करें और ट्रिमिंग चालू करें, और टूल ' Apple ', 'apple', और 'APPLE' को एक ही चीज़ मानेगा। यह सबसे उदार सेटिंग है और गड़बड़ इनपुट से सबसे साफ़ डीडुप्लिकेट सूची बनाती है।
इसके विपरीत, अगर आपको एक सख्त, सटीक-मेल वाली डीडुप्लिकेट चाहिए, तो केस संवेदनशीलता चालू और ट्रिमिंग बंद रहने दें। हटाए जाने के लिए पंक्ति को बाइट-दर-बाइट समान होना चाहिए, स्पेस समेत सब कुछ।
यह कहाँ अपनी उपयोगिता साबित करता है
विशिष्ट कामों में किसी मेलिंग सूची को साफ़ करना ताकि हर पता एक बार आए, ऐसी लॉग फ़ाइलों को सघन करना जहाँ एक ही त्रुटि सैकड़ों बार दोहराती है, कई सूचियों को बिना डुप्लिकेट के एक मास्टर में मिलाना, और इम्पोर्ट से पहले एक्सपोर्ट किए डेटा को साफ़-सुथरा करना शामिल है। जहाँ कहीं आपके पास लाइन-विभाजित मान हों जो अतिव्यापी हो सकते हैं, यह टूल उन्हें एक अद्वितीय सेट में समेट देता है।
चूँकि हर प्रविष्टि को एक पूरी पंक्ति के रूप में आँका जाता है, यह छोटे मानों की सूचियों पर, यानी प्रति पंक्ति एक वस्तु, चमकता है, न कि बहती हुई गद्य पर जहाँ 'डुप्लिकेट' कोई सार्थक अवधारणा नहीं है।
पंक्तियाँ, शब्द या वाक्यांश नहीं
यह याद रखना ज़रूरी है कि तुलना की इकाई पूरी पंक्ति है। दो पंक्तियाँ जो एक दोहराया गया शब्द साझा करती हैं पर कहीं और भिन्न होती हैं, दोनों रखी जाती हैं, क्योंकि पूरी पंक्तियों के रूप में वे समान नहीं हैं। यह टूल किसी पैराग्राफ़ के भीतर दोहराए गए शब्द या वाक्य नहीं ढूँढता; यह सख्ती से पूरी पंक्तियों पर काम करता है।
अगर आपके डुप्लिकेट अभी तक अपनी-अपनी पंक्तियों पर नहीं हैं, तो उन्हें पहले बाँट लें, उदाहरण के लिए Add Line Breaks को किसी कॉमा के बाद तोड़ने के लिए सेट करके, ताकि हर मान एक अलग पंक्ति पर आ जाए, और फिर डीडुप्लिकेट चलाएँ।
अक्सर पूछे जाने वाले प्रश्न
क्या यह मूल लाइन क्रम बरकरार रखता है?
क्या तुलना case sensitive है?
Trim Whitespace विकल्प क्या करता है?
किसी डुप्लिकेट लाइन की कौन-सी प्रति रखी जाती है?
क्या मेरा टेक्स्ट किसी सर्वर पर अपलोड होता है?
संबंधित टूल्स
इन उपयोगी टूल्स के साथ आगे बढ़ें