HTML से टेक्स्ट कनवर्टर
सभी HTML टैग को हटाकर HTML को प्लेन टेक्स्ट में बदलें जबकि सामग्री की संरचना को बनाए रखें।
रूपांतरण विकल्प:
HTML से टेक्स्ट कनवर्टर का उपयोग कैसे करें
- 1
अपना HTML पेस्ट करें
अपना HTML सोर्स या कॉपी किया स्निपेट बाईं ओर HTML इनपुट बॉक्स में डालें।
- 2
कन्वर्ज़न विकल्प चुनें
अपने मनचाहे आउटपुट से मेल खाने के लिए सेटिंग्स टॉगल करें, जैसे लाइन ब्रेक बनाए रखना, HTML एंटिटीज़ डिकोड करना, लिंक को [text](url) के रूप में रखना, या इमेज alt टेक्स्ट शामिल करना।
- 3
टेक्स्ट में बदलें
पढ़ने योग्य सामग्री और संरचना को बरकरार रखते हुए सभी टैग हटाने के लिए Convert to Text पर क्लिक करें।
- 4
सादा टेक्स्ट कॉपी करें
दाईं ओर साफ़ आउटपुट की समीक्षा करें और उसे अपने क्लिपबोर्ड पर भेजने के लिए Copy Text का इस्तेमाल करें।
HTML को साफ़, इस्तेमाल लायक़ टेक्स्ट तक छाँटना
HTML-से-टेक्स्ट रूपांतरण असल में क्या करता है
वेब पेज, ईमेल और CMS एक्सपोर्ट सादा टेक्स्ट नहीं होते। वे HTML होते हैं: p, div, span, a और strong जैसे टैगों का एक वृक्ष जो उन शब्दों के इर्द-गिर्द लिपटा होता है जिनकी आपको असल में परवाह होती है। जब आप वह स्रोत कॉपी करते हैं या कोई रिच स्निपेट पेस्ट करते हैं, तो आप साथ में इनलाइन स्टाइल, ट्रैकिंग एट्रिब्यूट और संरचनात्मक मार्कअप भी ढो लाते हैं जो उसी पल आड़े आते हैं जब आप पठनीय सामग्री को अकेले चाहते हैं। HTML को टेक्स्ट में बदलना उस वृक्ष पर चलता है और सिर्फ़ दिखते शब्द रखता है, हर टैग और एट्रिब्यूट को छोड़ते हुए।
लक्ष्य सिर्फ़ कोण कोष्ठक मिटाना नहीं है। टैगों को भोलेपन से खोजना-और-बदलना अनुच्छेदों को आपस में चटका देगा और एक सुथरे लेख को एक अटूट दीवार में बदल देगा। एक सही रूपांतरण अनुच्छेदों, शीर्षकों और सूची आइटमों जैसे ब्लॉक-स्तरीय एलिमेंटों को सीमाओं की तरह बरतता है, लाइन ब्रेक डालते हुए ताकि आउटपुट उसी तार्किक क्रम में पढ़ा जाए जैसे कोई इंसान पढ़ता, जबकि बोल्ड और इटैलिक जैसे इनलाइन एलिमेंट बस ग़ायब हो जाते हैं और अपना टेक्स्ट पीछे छोड़ देते हैं।
आप क्या रखते हैं और क्या खोते हैं
डिज़ाइन से ही, सादा टेक्स्ट दृश्य फ़ॉर्मेटिंग नहीं थाम सकता। बोल्ड, इटैलिक, फ़ॉन्ट आकार, रंग और CSS लेआउट सब छोड़ दिए जाते हैं क्योंकि किसी टेक्स्ट फ़ाइल में इनके रहने की कोई जगह नहीं होती। तालिकाएँ क्रमिक पंक्तियों में सिमट जाती हैं, और सटीक स्तंभ संरचना बनी नहीं रहती। यह अपेक्षित है: आप प्रस्तुति को सुवाह्यता से बदल रहे हैं।
लिंक और छवियाँ दिलचस्प बीच का मैदान हैं। किसी ऐंकर को [text](url) के रूप में रेंडर करने के लिए Preserve Links चालू करें ताकि गंतव्य एक पठनीय रूप में बचा रहे, और छवि को चुपचाप छोड़ देने के बजाय वर्णनात्मक alt एट्रिब्यूट रखने के लिए Include Image Alt Text चालू करें। अगर आप कोई ज़्यादा साफ़ पाठ चाहते हैं, तो इन्हें बंद रखें, या प्लेसहोल्डर और क्षैतिज रेखाओं को पूरी तरह दबाने के लिए Ignore Images और Ignore HR Tags का इस्तेमाल करें।
एक हल किया हुआ उदाहरण
मान लीजिए आप यह टुकड़ा पेस्ट करते हैं: एक अनुच्छेद जो Visit our shop पढ़ता है जहाँ shop, example.com का एक लिंक है, उसके बाद एक दूसरा अनुच्छेद जिसमें Tom & Jerry एंटिटी है। Preserve Links और Decode HTML Entities चालू रहने पर, आउटपुट दो साफ़ पंक्तियाँ बन जाता है: पहली पंक्ति पर Visit our [shop](https://example.com) और दूसरी पर Tom & Jerry। p टैग लाइन ब्रेक बन गए, ऐंकर को कोष्ठक-और-गोल-कोष्ठक रूप में फिर से लिखा गया, और & को वापस एक लिटरल ऐम्परसैंड में डिकोड कर दिया गया।
HTML एंटिटीज़ क्यों मायने रखती हैं
HTML कुछ कैरेक्टरों को एस्केप करता है ताकि ब्राउज़र उन्हें मार्कअप न समझ बैठे। एक ऐम्परसैंड & लिखा जाता है, एक लेस-दैन चिह्न < है, एक नॉन-ब्रेकिंग स्पेस है, और घुमावदार कोट अक्सर “ और ” के रूप में दिखते हैं। अगर आप डिकोडिंग छोड़ देते हैं, तो वे कच्चे अनुक्रम आपके टेक्स्ट में रिस आते हैं और टूटे हुए दिखते हैं। Decode HTML Entities चालू करें और वे वापस उन असली कैरेक्टरों में बदल जाते हैं जिनका वे प्रतिनिधित्व करते हैं: &, <, एक सामान्य स्पेस, और सही उद्धरण चिह्न। यह एक अकेला सेटिंग ऐसे आउटपुट का सबसे आम सुधार है जो लगभग सही दिखता है पर आवारा ऐम्परसैंड कोडों से भरा होता है।
लाइन ब्रेक और रैपिंग को नियंत्रित करना
दो सेटिंग्स यह आकार देती हैं कि नतीजा कैसे बिछाया जाता है। Preserve Line Breaks ब्लॉक एलिमेंटों से निहित ब्रेकों को रखता है ताकि अनुच्छेद अलग बने रहें, जबकि Preserve Whitespace स्पेस और इंडेंटेशन की उन कतारों को बनाए रखता है जिन्हें HTML आम तौर पर समेट देता, जो तब उपयोगी है जब मूल अंतर सार्थक हो, जैसे कोड या ASCII लेआउट में।
Word Wrap प्रति पंक्ति कैरेक्टरों की एक अधिकतम संख्या तय करता है और लंबे अनुच्छेदों को फ़िट होने के लिए फिर से बहा देता है, जो किसी टर्मिनल, किसी निश्चित-चौड़ाई वाले ईमेल, या किसी सादे-टेक्स्ट README में पेस्ट करने के लिए काम आता है। रैपिंग को पूरी तरह बंद करने के लिए इसे 0 पर सेट करें ताकि हर अनुच्छेद एक अकेली लंबी पंक्ति पर रहे, किसी ऐसे गंतव्य के लिए तैयार जो अपनी रैपिंग ख़ुद करता है।
असली-दुनिया के इस्तेमाल
जब भी किसी रिच सामग्री को निष्पक्ष टेक्स्ट बनना हो, इस टूल की ओर हाथ बढ़ाएँ। आम मामलों में किसी प्रकाशित वेब पेज से दोबारा इस्तेमाल या उद्धरण के लिए साफ़ टेक्स्ट निकालना, कहीं और इम्पोर्ट करने से पहले किसी CMS या न्यूज़लेटर एक्सपोर्ट को स्वच्छ करना, किसी HTML ईमेल से पठनीय बॉडी निकालना, किसी शब्द-गणना या पठनीयता जाँच के लिए सामग्री तैयार करना, और किसी अनुवाद टूल या ऐसी स्क्रिप्ट में साफ़ गद्य देना जो टैगों के बजाय सादे इनपुट की उम्मीद करती है, शामिल हैं।
यह विकास के दौरान एक तेज़ समझ-जाँच भी है। किसी रेंडर किए टेम्प्लेट को टेक्स्ट में बदलना असल पढ़ने का क्रम उजागर करता है और उस सामग्री को सामने ले आता है जो CSS से दृश्य रूप से छिपी है पर मार्कअप में अब भी मौजूद है, जो सुगम्यता और SEO ऑडिट के लिए मायने रख सकता है।
बचने लायक़ आम ग़लतियाँ
सबसे बड़ा जाल लेआउट के बचे रहने की उम्मीद करना है। अगर आपको तालिका संरचना, बुलेट पदानुक्रम, या स्टाइलिंग बचानी है, तो सादा टेक्स्ट ग़लत लक्ष्य है। इसके बजाय Markdown में बदलें या HTML ही रखें। एक दूसरी चूक एंटिटीज़ को डिकोड करना भूल जाना है और फिर हैरान होना कि आउटपुट में हर जगह & क्यों है। आख़िर में, याद रखें कि रूपांतरण सिर्फ़ उसी को दर्शाता है जो आपके पेस्ट किए मार्कअप में है: अगर कोई पेज लोड के बाद अपनी सामग्री JavaScript से बनाता है, तो जो कच्चा HTML आप View Source से कॉपी करते हैं वह लगभग ख़ाली हो सकता है, इसलिए इसके बजाय रेंडर किया गया DOM कॉपी करें।
निजता और यह कैसे चलता है
सब कुछ स्थानीय रूप से होता है। आपका HTML ब्राउज़र में JavaScript से पार्स और रूपांतरित किया जाता है, और न तो इनपुट और न ही नतीजे वाला टेक्स्ट कभी किसी सर्वर पर भेजा जाता है। यह टूल को आंतरिक पेजों, गोपनीय ईमेलों, और क्लाइंट के काम के लिए सुरक्षित बनाता है, और इसका मतलब है कि पेज लोड हो जाने के बाद यह किसी डगमगाते कनेक्शन पर भी काम करता रहता है।
अक्सर पूछे जाने वाले प्रश्न
यह टूल HTML टैग कैसे हटाता है?
क्या यह लिंक और इमेज alt टेक्स्ट रख सकता है?
क्या यह & और जैसी HTML एंटिटीज़ डिकोड करेगा?
क्या मैं आउटपुट में लाइन की लंबाई नियंत्रित कर सकता हूँ?
क्या मेरा HTML कहीं अपलोड होता है?
संबंधित टूल्स
इन उपयोगी टूल्स के साथ आगे बढ़ें