T

Text Machine

शक्तिशाली टेक्स्ट टूल्स, आपके ब्राउज़र में

डुप्लिकेट पंक्तियाँ हटाएँ

मूल क्रम बनाए रखते हुए आपके टेक्स्ट से दोहरी पंक्तियों को हटाता है।

इनपुट

डुप्लिकेट पंक्तियाँ हटाएँ का उपयोग कैसे करें

  1. 1

    अपना टेक्स्ट पेस्ट करें

    जिन लाइनों को आप साफ़ करना चाहते हैं उन्हें इनपुट बॉक्स में दर्ज करें या पेस्ट करें।

  2. 2

    विकल्प सेट करें

    डुप्लिकेट के लिए लाइनों की तुलना कैसे की जाए यह नियंत्रित करने हेतु Case Sensitive और Trim Whitespace टॉगल करें।

  3. 3

    डुप्लिकेट हटाएँ

    हर लाइन की पहली उपस्थिति रखते हुए दोहराई गई लाइनें हटाने के लिए Remove Duplicates पर क्लिक करें।

  4. 4

    नतीजा कॉपी करें

    अपना डुप्लिकेट-मुक्त टेक्स्ट सहेजने के लिए आउटपुट पर मौजूद कॉपी बटन का इस्तेमाल करें।

क्रम खोए बिना पंक्तियाँ डीडुप्लिकेट करना

पहली रखें, बाकी हटाएँ

यह टूल दोहराई गई पंक्तियाँ हटा देता है पर हर पंक्ति के पहली बार आने को बनाए रखता है। जैसे-जैसे यह ऊपर से नीचे पढ़ता है, यह हर उस पंक्ति को याद रखता है जिसे यह पहले देख चुका है; जब कोई पंक्ति फिर से आती है, तो वह बाद वाली प्रति हटा दी जाती है। बची हुई प्रति हमेशा अपनी मूल जगह पर बैठी रहती है, इसलिए आपके टेक्स्ट का समग्र अनुक्रम बिल्कुल बरकरार रहता है।

एक उदाहरण इसे स्पष्ट कर देता है। apple, banana, apple, cherry, banana पंक्तियाँ दिए जाने पर, आउटपुट apple, banana, cherry होता है। दूसरा apple और दूसरा banana हटा दिए जाते हैं, पर पहली उपस्थितियों का क्रम अछूता रहता है।

बिना सॉर्ट किए डीडुप्लिकेट करना

बहुत से लोग डुप्लिकेट हटाने के लिए किसी स्प्रेडशीट या कमांड-लाइन sort की ओर बढ़ते हैं, पर सॉर्टिंग एक दुष्प्रभाव के रूप में आपके क्रम को उलट-पुलट कर देती है। यह किसी वर्णानुक्रमित सूची के लिए तो ठीक है पर ऐसी हर चीज़ के लिए विनाशकारी है जहाँ अनुक्रम मायने रखता है, जैसे कोई कालक्रमिक लॉग, कोई रैंक की गई सूची, या किसी प्रक्रिया के चरण। यह टूल क्रम को ठीक इसलिए बनाए रखता है क्योंकि यह कभी सॉर्ट नहीं करता।

अगर आप वाकई एक सॉर्ट की गई, अद्वितीय सूची चाहते हैं, तो आउटपुट को बाद में सॉर्ट कर लें। दोनों क्रियाओं को अलग-अलग करना आपको नियंत्रण देता है: क्रम बनाए रखने के लिए पहले डीडुप्लिकेट करें, या अगर क्रम आपके लिए मायने नहीं रखता तो पहले सॉर्ट करें।

केस संवेदनशीलता, चालू या बंद

डिफ़ॉल्ट रूप से तुलना case sensitive होती है, इसलिए Apple और apple अलग-अलग पंक्तियाँ मानी जाती हैं और दोनों रखी जाती हैं। Case Sensitive बंद करें और टूल उन्हें एक ही पंक्ति मानता है, केवल पहली को रखते हुए। यह असल-दुनिया के डेटा के साथ लगातार मायने रखता है जहाँ एक ही मान मिश्रित कैपिटलाइज़ेशन में आता है।

जब आप ईमेल पते, टैग, या उपयोगकर्ता नाम जैसी चीज़ें डीडुप्लिकेट कर रहे हों तब case-insensitive मैचिंग का इस्तेमाल करें, जहाँ '[email protected]' और '[email protected]' को साफ़ तौर पर एक ही गिना जाना चाहिए। जब कैपिटलाइज़ेशन सार्थक हो, जैसे कोड पहचानकर्ताओं में अंतर करना, तब इसे case sensitive रखें।

तुलना से पहले व्हाइटस्पेस छाँटना

Trim Whitespace विकल्प यह तय करते समय कि दो पंक्तियाँ मैच करती हैं या नहीं, शुरुआती और अंतिम स्पेस तथा टैब को नज़रअंदाज़ कर देता है। इसके बिना, ऐसी पंक्ति जो किसी अदृश्य अंतिम स्पेस के साथ खत्म होती है, तकनीकी रूप से उसी पंक्ति से अलग होती है जिसमें वह न हो, और दोनों बच जातीं। इसके साथ, वे लगभग-समान पंक्तियाँ एक ही प्रविष्टि में समा जाती हैं।

यह उस सबसे आम कारण को पकड़ लेता है जिसकी वजह से डुप्लिकेट हटाना ज़ाहिर दोहरावों को 'चूकता' लगता है: अदृश्य व्हाइटस्पेस। जब आपका डेटा कई पेस्ट किए स्रोतों से इकट्ठा किया गया हो, तब trim चालू करना आम तौर पर सही फ़ैसला होता है।

दोनों विकल्पों को मिलाना

असली ताकत दोनों टॉगल को एक साथ इस्तेमाल करने से आती है। केस संवेदनशीलता बंद करें और ट्रिमिंग चालू करें, और टूल ' Apple ', 'apple', और 'APPLE' को एक ही चीज़ मानेगा। यह सबसे उदार सेटिंग है और गड़बड़ इनपुट से सबसे साफ़ डीडुप्लिकेट सूची बनाती है।

इसके विपरीत, अगर आपको एक सख्त, सटीक-मेल वाली डीडुप्लिकेट चाहिए, तो केस संवेदनशीलता चालू और ट्रिमिंग बंद रहने दें। हटाए जाने के लिए पंक्ति को बाइट-दर-बाइट समान होना चाहिए, स्पेस समेत सब कुछ।

यह कहाँ अपनी उपयोगिता साबित करता है

विशिष्ट कामों में किसी मेलिंग सूची को साफ़ करना ताकि हर पता एक बार आए, ऐसी लॉग फ़ाइलों को सघन करना जहाँ एक ही त्रुटि सैकड़ों बार दोहराती है, कई सूचियों को बिना डुप्लिकेट के एक मास्टर में मिलाना, और इम्पोर्ट से पहले एक्सपोर्ट किए डेटा को साफ़-सुथरा करना शामिल है। जहाँ कहीं आपके पास लाइन-विभाजित मान हों जो अतिव्यापी हो सकते हैं, यह टूल उन्हें एक अद्वितीय सेट में समेट देता है।

चूँकि हर प्रविष्टि को एक पूरी पंक्ति के रूप में आँका जाता है, यह छोटे मानों की सूचियों पर, यानी प्रति पंक्ति एक वस्तु, चमकता है, न कि बहती हुई गद्य पर जहाँ 'डुप्लिकेट' कोई सार्थक अवधारणा नहीं है।

पंक्तियाँ, शब्द या वाक्यांश नहीं

यह याद रखना ज़रूरी है कि तुलना की इकाई पूरी पंक्ति है। दो पंक्तियाँ जो एक दोहराया गया शब्द साझा करती हैं पर कहीं और भिन्न होती हैं, दोनों रखी जाती हैं, क्योंकि पूरी पंक्तियों के रूप में वे समान नहीं हैं। यह टूल किसी पैराग्राफ़ के भीतर दोहराए गए शब्द या वाक्य नहीं ढूँढता; यह सख्ती से पूरी पंक्तियों पर काम करता है।

अगर आपके डुप्लिकेट अभी तक अपनी-अपनी पंक्तियों पर नहीं हैं, तो उन्हें पहले बाँट लें, उदाहरण के लिए Add Line Breaks को किसी कॉमा के बाद तोड़ने के लिए सेट करके, ताकि हर मान एक अलग पंक्ति पर आ जाए, और फिर डीडुप्लिकेट चलाएँ।

अक्सर पूछे जाने वाले प्रश्न

क्या यह मूल लाइन क्रम बरकरार रखता है?
हाँ। टूल बाद के दोहराव हटाता है पर हर लाइन की पहली उपस्थिति को उसके मूल स्थान पर बनाए रखता है, इसलिए आपके टेक्स्ट का क्रम बरकरार रहता है।
क्या तुलना case sensitive है?
आप तय करते हैं। डिफ़ॉल्ट रूप से यह अलग-अलग कैपिटलाइज़ेशन वाली लाइनों को अलग मानता है, पर Case Sensitive बंद करने से Apple और apple एक ही लाइन मानी जाती हैं।
Trim Whitespace विकल्प क्या करता है?
यह लाइनों की तुलना करते समय शुरुआती और अंतिम स्पेस को नज़रअंदाज़ करता है, इसलिए दो लाइनें जो केवल अतिरिक्त स्पेस से अलग होती हैं, उन्हें डुप्लिकेट माना जाता है।
किसी डुप्लिकेट लाइन की कौन-सी प्रति रखी जाती है?
जब कोई लाइन पहली बार आती है उसे रखा जाता है, और उसके बाद की हर समान लाइन को आउटपुट से हटा दिया जाता है।
क्या मेरा टेक्स्ट किसी सर्वर पर अपलोड होता है?
नहीं। सारी प्रोसेसिंग आपके ब्राउज़र में ही होती है, इसलिए आपका टेक्स्ट कभी आपके डिवाइस से बाहर नहीं जाता, और यह टूल बिना रजिस्ट्रेशन के मुफ़्त है।

संबंधित टूल्स

इन उपयोगी टूल्स के साथ आगे बढ़ें

लाइन ब्रेक हटाएँ

लाइन ब्रेक जोड़ें

खाली पंक्तियाँ हटाएँ

सूची को वर्णानुक्रम में क्रमबद्ध करें

वर्णानुक्रमिक क्रम सॉर्टर

लाइन ब्रेक से पैराग्राफ कनवर्टर