HTML Entity Encoder/Decoder
This tool allows you to convert text with special characters to HTML entities and vice versa. HTML entities help display special characters correctly on web pages.
Mode
<
<
Less than sign
>
>
Greater than sign
&
&
Ampersand
"
"
Double quotation mark
'
'
Single quotation mark
©
©
Copyright symbol
®
®
Registered trademark
HTML एंटिटी एनकोडर/डिकोडर का उपयोग कैसे करें
- 1
अपना टेक्स्ट दर्ज करें
जिस टेक्स्ट या HTML स्निपेट को आप बदलना चाहते हैं उसे इनपुट बॉक्स में पेस्ट करें।
- 2
encode या decode चुनें
विशेष अक्षरों को HTML एंटिटीज़ में बदलने के लिए Encode पर क्लिक करें, या एंटिटीज़ को वापस अक्षरों में बदलने के लिए Decode पर।
- 3
नतीजा पाएँ
बदला हुआ आउटपुट तुरंत रिज़ल्ट पैनल में दिखाई देता है।
- 4
आउटपुट कॉपी करें
अपनी परियोजना के लिए एनकोड या डिकोड किया टेक्स्ट लेने हेतु Copy Result का इस्तेमाल करें।
HTML एंटिटीज़ की एक व्यावहारिक गाइड
HTML एंटिटी क्या होती है
एक HTML एंटिटी, ज़्यादा औपचारिक रूप से एक कैरेक्टर रेफ़रेंस, एक छोटा कोड है जो HTML में किसी एक अकेले कैरेक्टर की जगह खड़ा रहता है। हर एंटिटी एक ऐम्परसैंड (&) से शुरू होती है और एक अर्धविराम (;) पर ख़त्म होती है। एंटिटीज़ आपको ऐसे कैरेक्टर शामिल करने देती हैं जिन्हें ब्राउज़र वरना मार्कअप समझकर ग़लत व्याख्या कर देता, ऐसे कैरेक्टर जिन्हें टाइप करना मुश्किल हो, या ऐसे कैरेक्टर जो आपके कीबोर्ड पर मौजूद ही न हों, और यह सब करते हुए स्रोत फ़ाइल को सादे ASCII में बनाए रखती हैं।
एंटिटीज़ दो अलग वजहों से मायने रखती हैं। पहली, कुछ कैरेक्टर ख़ुद HTML द्वारा आरक्षित हैं और सही दिखने के लिए इन्हें एस्केप करना ज़रूरी है। दूसरी, चिह्नों, मात्रा वाले अक्षरों, मुद्रा चिह्नों, तीरों और इमोजी की विशाल दुनिया को फ़ाइल की टेक्स्ट एन्कोडिंग चाहे जो हो, रेफ़रेंस के रूप में भरोसेमंद ढंग से लिखा जा सकता है। यह टूल कैरेक्टरों को एंटिटीज़ में एन्कोड करता है और एंटिटीज़ को वापस उन कैरेक्टरों में डिकोड करता है जिनका वे प्रतिनिधित्व करती हैं।
नामित बनाम संख्यात्मक रेफ़रेंस
एंटिटी लिखने के दो तरीक़े हैं, और जो वे बनाते हैं उसमें वे आपस में बदले जा सकते हैं। एक नामित रेफ़रेंस एक इंसान-पठनीय लेबल का इस्तेमाल करता है, जैसे कॉपीराइट चिह्न के लिए ©, एक ऐम्परसैंड के लिए &, या एक नॉन-ब्रेकिंग स्पेस के लिए । HTML इन नामों की एक तय सूची परिभाषित करता है, इसलिए सिर्फ़ उन्हीं कैरेक्टरों को इस तरह लिखा जा सकता है जिन्हें कोई नाम सौंपा गया हो।
एक संख्यात्मक रेफ़रेंस नाम के बजाय कैरेक्टर का यूनिकोड कोड पॉइंट इस्तेमाल करता है, और यह किसी भी कैरेक्टर का प्रतिनिधित्व कर सकता है। दशमलव रूप एक ऐम्परसैंड, एक हैश, आधार 10 में कोड पॉइंट, और एक अर्धविराम होता है — उदाहरण के लिए ©। हेक्साडेसिमल रूप हैश के बाद एक x जोड़ता है और कोड पॉइंट को आधार 16 में देता है — उदाहरण के लिए ©। ©, © और © तीनों एक जैसा © चिह्न रेंडर करते हैं, क्योंकि दशमलव में 169, हेक्साडेसिमल में A9 के बराबर है और दोनों कॉपीराइट कोड पॉइंट के बराबर हैं।
वे पाँच जिन्हें हमेशा एस्केप करना ज़रूरी है
ज़्यादातर कैरेक्टरों को एन्कोड करना वैकल्पिक है, पर एक छोटा समूह HTML स्रोत में असल में अनिवार्य है। ऐम्परसैंड & (&) को एस्केप करना ज़रूरी है क्योंकि यह हर एंटिटी शुरू करता है; इसे किसी शब्द के बग़ल में कच्चा छोड़ें और ब्राउज़र किसी ऐसी एंटिटी को पार्स करने की कोशिश कर सकता है जो वहाँ है ही नहीं। लेस-दैन चिह्न < (<) और ग्रेटर-दैन चिह्न > (>) को टेक्स्ट में एस्केप करना ज़रूरी है क्योंकि ये टैगों की सीमा तय करते हैं। एट्रिब्यूट मानों के अंदर, डबल कोट " (") और एपॉस्ट्रॉफ़ी ' (') को एस्केप करना ज़रूरी है ताकि वे एट्रिब्यूट को जल्दी बंद न कर दें।
बाक़ी सब कुछ बस सुविधा है। आप é को किसी UTF-8 फ़ाइल में सीधे लिख सकते हैं या é या é के रूप में — सब मान्य हैं। आरक्षित पाँच अलग हैं: इन्हें ग़लत करना टूटा हुआ मार्कअप पैदा करता है या, अविश्वसनीय इनपुट के साथ, एक क्रॉस-साइट स्क्रिप्टिंग छेद, इसलिए ये वही कैरेक्टर हैं जिन्हें आपको कभी ग़लत जगह बिना-एस्केप किए नहीं छोड़ना चाहिए।
हल किया हुआ उदाहरण: चिह्न और मात्राएँ
मान लीजिए आप चाहते हैं कि कोई फ़ुटर पढ़े "© 2026 Café Ünïcode — 100% safe"। इनमें से कई कैरेक्टर सादे ASCII नहीं हैं। कॉपीराइट चिह्न को © या © के रूप में लिखा जा सकता है। Café में é, é या é है, और Ü, Ü या Ü है। एम डैश — , — या — है, और जो नॉन-ब्रेकिंग स्पेस "100%" को साथ रखता है वह है।
पूरी स्ट्रिंग को एन्कोड करना © 2026 Café Ünïcode — 100% safe जैसा कुछ देता है, जिसके बारे में गारंटी है कि वह एक जैसा दिखेगा चाहे पेज की कैरेक्टर एन्कोडिंग कैसे भी कॉन्फ़िगर हो। इसे यहाँ डिकोड करना इस प्रक्रिया को उलट देता है और असली चिह्नों के साथ आपको वापस पठनीय पंक्ति देता है।
नामित या संख्यात्मक चुनना
नामित एंटिटीज़ पठनीयता पर जीतती हैं। © और — किसी भविष्य के पाठक को बिलकुल बता देती हैं कि कैरेक्टर क्या है, जो स्रोत को संख्यात्मक कोडों की दीवार की तुलना में रखरखाव में आसान बनाता है। अदला-बदली कवरेज की है: सिर्फ़ उन्हीं कैरेक्टरों को नाम से लिखा जा सकता है जिन्हें कोई नाम सौंपा गया हो, और यह सूची, बड़ी होने के बावजूद, सब कुछ शामिल नहीं करती।
संख्यात्मक रेफ़रेंस सार्वभौमिकता और सटीकता पर जीतते हैं। चूँकि वे यूनिकोड कोड पॉइंट को सीधे संबोधित करते हैं, वे अस्तित्व में मौजूद किसी भी कैरेक्टर को एन्कोड कर सकते हैं, जिनमें वे भी शामिल हैं जिनका कोई नाम नहीं और जिनमें इमोजी भी शामिल हैं। वे असंदिग्ध भी होते हैं, जो तब काम आता है जब आपको किसी अनजाने चिह्न के बारे में निश्चित होना हो। एक आम चलन यह है कि जाने-पहचाने मुट्ठी भर (©, &, , —) के लिए नामित एंटिटीज़ और किसी भी विदेशी चीज़ के लिए संख्यात्मक रेफ़रेंस इस्तेमाल किए जाएँ।
इमोजी और बुनियादी रेंज से परे के कैरेक्टर
इमोजी और कई चिह्न यूनिकोड रेंज में ऊँचाई पर रहते हैं, उन मानों से ऊपर जिन्हें एक अकेली पुरानी-शैली की कोड इकाई थाम सकती है, पर संख्यात्मक रेफ़रेंस इन्हें साफ़-सुथरे ढंग से संभालते हैं क्योंकि वे बस कोड पॉइंट का नाम लेते हैं। ग्रिनिंग फ़ेस इमोजी का कोड पॉइंट U+1F600 है, इसलिए इसे दशमलव रेफ़रेंस 😀 या हेक्साडेसिमल रेफ़रेंस 😀 के रूप में लिखा जा सकता है, जो दोनों एक ही ग्लिफ़ बनाते हैं।
व्यवहार में, अपनी फ़ाइल को UTF-8 के रूप में सहेजना और इमोजी को सीधे पेस्ट करना आम तौर पर ज़्यादा सरल और उतना ही सही होता है। संख्यात्मक रेफ़रेंस तब मूल्यवान हो जाते हैं जब किसी पाइपलाइन पर कच्चे बाइट सुरक्षित रखने का भरोसा न किया जा सके — कोई ईमेल टेम्प्लेट, कोई ऐसा सिस्टम जो ASCII तक चपटा कर देता हो, या कोई ऐसा संदर्भ जहाँ आप सटीक कोड पॉइंट को असंदिग्ध रूप से दर्ज रखना चाहते हों। चाहे जो हो, जो कैरेक्टर दिखता है वह पूरी तरह उसके कोड पॉइंट से तय होता है।
गड़बड़ाए एंटिटी टेक्स्ट को डिकोड करना
एक बहुत आम असली-दुनिया का काम ऐसे टेक्स्ट को साफ़ करना है जो दिखती एंटिटी कोडों से भरा आता है। आप किसी वेब पेज या डेटाबेस एक्सपोर्ट से कोई अनुच्छेद कॉपी करते हैं और सामान्य विराम चिह्नों के बजाय आपको उसमें बिखरे हुए &, ', " और ’ दिखते हैं। इसका मतलब है कि वह टेक्स्ट कहीं ऊपर HTML-एन्कोड किया गया था और प्रदर्शन के लिए कभी डिकोड नहीं हुआ। इसे यहाँ Decode मोड में पेस्ट करना उन रेफ़रेंसों को वापस असली &, ', " और घुमावदार एपॉस्ट्रॉफ़ी कैरेक्टरों में बदल देता है।
डबल-एन्कोडिंग पर नज़र रखें, वह स्थिति जब टेक्स्ट दो बार एस्केप हुआ हो और आपको &amp; या &#39; जैसे अनुक्रम दिखें। यहाँ लिटरल कैरेक्टर &amp; को पहले & और फिर & बनना चाहिए, इसलिए इसका हल है जब तक कोई एंटिटी न बचे तब तक एक से ज़्यादा बार डिकोड करना। अगर एक अकेला डिकोड पास अब भी आपके आउटपुट में & छोड़ देता है, तो दूसरी परत हटाने के लिए नतीजे को फिर से Decode के ज़रिए चलाएँ।
आम चूकें
सबसे बार-बार होने वाली ग़लती गुमशुदा अर्धविराम है। कोई एंटिटी तभी मान्य होती है जब वह समाप्त की गई हो, इसलिए बिना अर्धविराम वाला © शायद कॉपीराइट चिह्न के रूप में रेंडर न हो। एक संबंधित ग़लती हाथ से एस्केप करते समय ऐम्परसैंड को पहले के बजाय आख़िर में एन्कोड करना है, जो आपकी बाक़ी एंटिटीज़ को &lt; जैसे लिटरल टेक्स्ट में बदल देता है।
यह भी याद रखें कि एंटिटीज़ एक HTML अवधारणा हैं, अपने आप में कोई सुरक्षा सीमा नहीं। अविश्वसनीय इनपुट को एंटिटीज़ में एन्कोड करना टूटे मार्कअप और XSS को रोकने का हिस्सा है, पर इसे सही संदर्भ में और आउटपुट के समय किया जाना चाहिए, हर मर्ज़ की दवा के रूप में उस पर भरोसा नहीं किया जाना चाहिए। आख़िर में, सामान्य सामग्री के अंदर ऐसे कैरेक्टरों को एन्कोड न करें जिन्हें इसकी ज़रूरत नहीं — ज़रूरत से ज़्यादा एन्कोडिंग स्रोत को पढ़ने में कठिन बना देती है और जब फ़ाइल पहले से UTF-8 हो तो कोई फ़ायदा नहीं देती।
अक्सर पूछे जाने वाले प्रश्न
HTML एंटिटीज़ क्या हैं और इन्हें क्यों इस्तेमाल करें?
एनकोडर कौन-से अक्षर बदलता है?
क्या मैं एंटिटीज़ को वापस सामान्य अक्षरों में बदल सकता हूँ?
क्या यह टूटे HTML या XSS को रोकने के लिए उपयोगी है?
क्या मेरा टेक्स्ट किसी सर्वर पर भेजा जाता है?
संबंधित टूल्स
इन उपयोगी टूल्स के साथ आगे बढ़ें