T

Text Machine

शक्तिशाली टेक्स्ट टूल्स, आपके ब्राउज़र में

संयोग सूचकांक कैलकुलेटर

नापें कि किसी टेक्स्ट में अक्षरों का बँटवारा कितना असमान है, और कुंजी की लंबाई सीधे स्तंभ तालिका से पढ़ लें।

आज़माएँ:

टेक्स्ट

नापने के लिए कोई टेक्स्ट चिपकाएँ। सीज़र और Vigenère के नमूने वही अंश हैं जो अंग्रेज़ी नमूने में है, इसलिए आप देख सकते हैं कि हर तरह का सिफर इस संख्या के साथ क्या करता है।

संयोग सूचकांक कैलकुलेटर का उपयोग कैसे करें

  1. 1

    टेक्स्ट चिपकाएँ

    सादा या एन्क्रिप्टेड टेक्स्ट बॉक्स में डालें। केवल A से Z तक के अक्षर शामिल होते हैं; बड़े-छोटे अक्षर, स्पेस, अंक और विराम चिह्न अनदेखे रहते हैं, इसलिए फ़ॉर्मैटिंग संख्या को हिला नहीं सकती।

  2. 2

    सूचकांक पढ़ें

    कच्चा IC यह संभावना है कि यादृच्छिक रूप से उठाए गए दो अक्षर एक ही अक्षर निकलें। सामान्यीकृत आँकड़ा वही मान समान वर्णमाला के सापेक्ष है, जहाँ 1.00 का अर्थ यादृच्छिक और लगभग 1.73 का अर्थ अंग्रेज़ी है।

  3. 3

    तय करें कि सिफर किस तरह का है

    लगभग 0.066 का मतलब है कि अक्षरों का बँटवारा जस का तस है, यानी सादा टेक्स्ट या साधारण प्रतिस्थापन। लगभग 0.038 का मतलब है कि उसे सपाट कर दिया गया है, जो दोहराई जाने वाली कुंजी के सिफर की ओर इशारा करता है।

  4. 4

    स्तंभ तालिका में लंबाई खोजें

    अगर टेक्स्ट बहुवर्णी लगता है, तो वह सबसे छोटी लंबाई खोजें जिसका स्तंभवार IC फिर 0.066 की ओर चढ़ता है। वही कुंजी की लंबाई है, और यही संख्या Vigenère सॉल्वर को चाहिए।

संयोग सूचकांक, समझाया गया

एक संख्या, एक सवाल

संयोग सूचकांक एक सँकरे सवाल का जवाब देता है: अगर आप किसी टेक्स्ट में दो बार हाथ डालें और हर बार एक अक्षर निकालें, तो कितनी बार एक ही अक्षर दो बार निकलेगा? अगर थैले में 26 अक्षर बराबर मात्रा में हों तो जवाब 26 में 1 है, यानी लगभग 0.0385। अंग्रेज़ी के लिए यह लगभग दोगुना, करीब 0.066 है, क्योंकि अंग्रेज़ी बराबर भरा थैला नहीं है। E, T, A और O बहुत बड़ा हिस्सा सँभालते हैं, जबकि J, Q, X और Z मुश्किल से आते हैं।

यही अंतर इस आँकड़े की पूरी उपयोगिता है। यह नाम बदलने से नहीं टूटता: अगर आप हर A को Q और हर Q को A कर दें, गिनतियाँ जगह बदल लेंगी पर असमानता नहीं बदलेगी, इसलिए सूचकांक वही रहेगा। पर यह कई वर्णमालाओं में फैलाए जाने से नहीं बचता, और दोहराई जाने वाली कुंजी का सिफर ठीक यही करता है।

यह क्या बता सकता है और क्या नहीं

0.066 के आसपास का IC बताता है कि अक्षरों का बँटवारा जस का तस है। इसमें सामान्य सादा टेक्स्ट, सीज़र खिसकाव, अटबश दर्पण और हर साधारण प्रतिस्थापन आते हैं, और इसीलिए एकवर्णी सिफर इस संख्या से नहीं बल्कि आवृत्ति विश्लेषण से तोड़ा जाता है।

0.038 के आसपास का IC बताता है कि बँटवारा सपाट कर दिया गया है। कोई चीज़ सादे टेक्स्ट के एक अक्षर को कई एन्क्रिप्टेड अक्षरों पर मैप कर रही है, जो Vigenère और उसके परिवार की पहचान है, या फिर वाकई यादृच्छिक स्ट्रिंग की।

बीच का पाठ आम तौर पर यह बताता है कि टेक्स्ट बहुत छोटा है, न कि यह कि सिफर असामान्य है। लगभग सौ अक्षरों से नीचे सूचकांक इतना डोलता है कि भ्रमित कर दे, और लगभग तीन सौ से नीचे उसे फ़ैसले के बजाय संकेत मानना ठीक रहता है।

असल काम स्तंभ तालिका करती है

पूरे टेक्स्ट की एक संख्या आपको सिफर का प्रकार बताती है। कुंजी की लंबाई खोजने के लिए दूसरा कदम चाहिए, और यही वह कदम है जिसे ज़्यादातर कैलकुलेटर छोड़ देते हैं।

अक्षर लीजिए और उन्हें L ढेरों में बाँटिए: स्थान 1, L+1 और 2L+1 पहले ढेर में, स्थान 2 और L+2 दूसरे ढेर में, और इसी तरह आगे। अगर L असली कुंजी लंबाई है, तो एक ढेर का हर अक्षर एक ही कुंजी अक्षर से खिसका है, इसलिए वह ढेर अंग्रेज़ी का सीज़र है और उसकी असमानता बनाए रखता है। अगर L गलत है, तो हर ढेर में अलग-अलग मात्रा में खिसके अक्षर मिल जाते हैं और वह सपाट निकलता है।

इसलिए ढेरों पर औसत किया गया स्तंभवार IC असली कुंजी लंबाई पर और उसके हर गुणज पर ऊपर उठता है। तालिका में नीचे तक पढ़कर पहली उछलती लंबाई खोजना Vigenère कुंजी लंबाई निकालने का शास्त्रीय तरीका है, और असली टेक्स्ट पर यह फ्रीडमैन के सूत्र से ज़्यादा भरोसेमंद है।

आगे कहाँ जाएँ

अगर स्तंभ तालिका किसी लंबाई की ओर इशारा करती है, तो कासिस्की परीक्षण स्वाभाविक दूसरी राय है: यह अक्षर आँकड़ों के बजाय दोहराए गए अनुक्रमों के बीच की दूरियों से चलता है, इसलिए अलग जगहों पर विफल होता है। दो स्वतंत्र तरीकों का एक ही संख्या पर सहमत होना अकेले किसी एक से कहीं मज़बूत प्रमाण है।

लंबाई पर भरोसा हो जाने पर Vigenère सॉल्वर एन्क्रिप्टेड टेक्स्ट लेगा, उसे उतने स्तंभों में बाँटेगा, हर स्तंभ को सीज़र सिफर की तरह तोड़ेगा और आपको कुंजी शब्द तथा सादा टेक्स्ट लौटा देगा।

अक्सर पूछे जाने वाले प्रश्न

संयोग सूचकांक क्या है?
यह वह संभावना है कि किसी टेक्स्ट से यादृच्छिक रूप से चुने गए दो अक्षर एक ही अक्षर निकलें। सूत्र में, यह हर अक्षर की गिनती पर n(n-1) का योग है, जिसे पूरे टेक्स्ट के लिए N(N-1) से भाग दिया जाता है। अंग्रेज़ी लगभग 0.066 पर आती है क्योंकि कुछ ही अक्षर अधिकांश काम करते हैं; समान यादृच्छिक वर्णमाला 1/26 यानी लगभग 0.0385 देती है।
मेरी संख्या किसी दूसरे कैलकुलेटर से अलग क्यों है?
लगभग हमेशा सामान्यीकरण की वजह से। कुछ टूल कच्ची संभावना बताते हैं और कुछ उसे 26 से गुणा करते हैं, इसलिए वही टेक्स्ट कहीं 0.0667 और कहीं 1.73 पढ़ा जाता है। यहाँ दोनों आँकड़े दिखते हैं। दूसरी आम वजह यह है कि किसी टूल ने स्पेस या अंक भी वर्ण मान लिए; यह टूल सिर्फ़ A से Z तक के अक्षर गिनता है।
संयोग सूचकांक कुंजी की लंबाई कैसे खोजता है?
अकेले वह नहीं खोजता। लंबाई खोजने का काम एन्क्रिप्टेड टेक्स्ट को L स्तंभों में बाँटकर हर स्तंभ को अलग नापने से होता है। सही L पर हर स्तंभ एक ही दोहराए गए खिसकाव से एन्क्रिप्ट हुआ होता है, इसलिए वह अंग्रेज़ी का सीज़र है और अंग्रेज़ी का IC बनाए रखता है। गलत L पर स्तंभ मिश्रण बन जाते हैं और सपाट रहते हैं। स्तंभ तालिका सभी उम्मीदवारों को साथ-साथ दिखाती है।
फ्रीडमैन अनुमान क्या है और क्या उस पर भरोसा करें?
यह 1922 का एक सूत्र है जो एक IC को अनुमानित कुंजी लंबाई में बदल देता है। स्तंभ तालिका के साथ जाँच के तौर पर यह उपयोगी है, और इतनी बार गलत होता है कि इसे अकेले कभी इस्तेमाल नहीं करना चाहिए, खासकर छोटे टेक्स्ट पर। डैश तब दिखता है जब आपका टेक्स्ट पहले से ही सादे पाठ जितना असमान है, या इतना छोटा है कि IC बनता ही नहीं। सूत्र यह मानकर चलता है कि किसी दोहराई जाने वाली कुंजी ने टेक्स्ट को सपाट कर दिया है, इसलिए उस दायरे के बाहर अनुमान लगाने को कुछ बचता ही नहीं और कोई भी संख्या गढ़ी हुई होगी।
5, 10 और 15 तीनों अच्छे अंक क्यों पाते हैं?
क्योंकि 10 स्तंभों में बाँटना असल के 5 स्तंभों को आधा-आधा करना है, और हर आधा हिस्सा अपना अकेला खिसकाव बनाए रखता है। असली लंबाई का हर गुणज उसके अंक विरासत में पा लेता है। जवाब उस परिवार का सबसे छोटा सदस्य है, इसीलिए सुझाव सूची गुणजों को हटा देती है।
क्या यह बता सकता है कि टेक्स्ट किस भाषा में है?
बहुत मोटे तौर पर ही। तुलना तालिका दिखाती है कि आपका टेक्स्ट प्रकाशित आँकड़ों के मुक़ाबले कहाँ बैठता है, पर कई भाषाओं के मान आपस में मिलते-जुलते हैं और छोटा नमूना उन अंतरों से ज़्यादा हिलता है। इसे प्राकृतिक भाषा और यादृच्छिक दिखने वाले टेक्स्ट को अलग करने के लिए इस्तेमाल करें, फ़्रेंच और स्पेनिश में से चुनने के लिए नहीं।
क्या मेरा टेक्स्ट ब्राउज़र से बाहर जाता है?
नहीं। पूरी गणना इसी पेज पर होती है। कुछ भी अपलोड, दर्ज या कहीं संग्रहीत नहीं होता।

संबंधित टूल्स

इन उपयोगी टूल्स के साथ आगे बढ़ें

कासिस्की परीक्षण

विजेनेर सॉल्वर

आवृत्ति विश्लेषण

साइफर पहचानकर्ता

प्रतिस्थापन सॉल्वर

Unix टाइमस्टैम्प परिवर्तक