T

Text Machine

Des outils de texte puissants, dans votre navigateur

Calculateur d'indice de coïncidence

Mesurez à quel point la répartition des lettres d'un texte est inégale, et lisez la longueur de clé directement dans le tableau par colonnes.

Essayer :

Texte

Collez un texte pour le mesurer. Les échantillons César et Vigenère reprennent le même passage que l'échantillon anglais, ce qui permet de voir ce que chaque type de chiffrement fait au nombre.

Comment utiliser Calculateur d'indice de coïncidence

  1. 1

    Collez le texte

    Déposez du texte clair ou chiffré dans le cadre. Seules les lettres de A à Z participent ; la casse, les espaces, les chiffres et la ponctuation sont ignorés, si bien que la mise en forme ne peut pas déplacer le nombre.

  2. 2

    Lisez l'indice

    L'IC brut est la probabilité que deux lettres tirées au hasard soient la même lettre. Le chiffre normalisé est cette valeur rapportée à un alphabet uniforme, où 1,00 signifie aléatoire et environ 1,73 signifie anglais.

  3. 3

    Déterminez le type de chiffrement

    Autour de 0,066, la répartition des lettres est intacte : c'est du texte clair ou une substitution simple. Autour de 0,038, elle a été aplatie, ce qui oriente vers un chiffrement à clé répétée.

  4. 4

    Trouvez la longueur dans le tableau par colonnes

    Si le texte semble polyalphabétique, cherchez la plus courte longueur dont l'IC par colonnes remonte vers 0,066. C'est la longueur de la clé, et c'est le nombre dont le solveur Vigenère a besoin.

L'indice de coïncidence, expliqué

Un nombre, une question

L'indice de coïncidence répond à une question étroite : si vous plongez deux fois la main dans un texte et en sortez une lettre à chaque fois, à quelle fréquence obtenez-vous deux fois la même lettre ? Pour un sac de 26 lettres également fréquentes, la réponse est 1 sur 26, environ 0,0385. Pour l'anglais, c'est presque le double, environ 0,066, parce que l'anglais n'est pas un sac équilibré. E, T, A et O abattent un travail énorme, tandis que J, Q, X et Z n'apparaissent presque jamais.

Cet écart fait toute l'utilité de la statistique. Elle survit au réétiquetage : si vous échangez chaque A contre un Q et chaque Q contre un A, les effectifs se déplacent mais l'inégalité, elle, ne bouge pas, donc l'indice reste identique. Elle ne survit pas à une répartition sur plusieurs alphabets, ce qui est exactement ce que fait un chiffrement à clé répétée.

Ce qu'il peut et ne peut pas vous dire

Un IC proche de 0,066 dit que la répartition des lettres est intacte. Cela couvre le texte clair ordinaire, un décalage de César, un miroir Atbash et toute substitution simple, et c'est pourquoi on casse un chiffrement monoalphabétique par analyse de fréquences plutôt qu'avec ce nombre.

Un IC proche de 0,038 dit que la répartition a été aplatie. Quelque chose fait correspondre une lettre du texte clair à plusieurs lettres chiffrées, ce qui est la signature de Vigenère et de ses proches, ou d'une chaîne réellement aléatoire.

Une lecture intermédiaire signifie généralement que le texte est trop court, et non que le chiffrement est inhabituel. En dessous d'une centaine de lettres, l'indice fluctue assez pour induire en erreur, et en dessous de trois cents environ, mieux vaut le traiter comme un indice que comme un verdict.

C'est le tableau par colonnes qui fait le travail

Le nombre unique portant sur tout le texte vous donne le type de chiffrement. Trouver la longueur de la clé demande une deuxième étape, et c'est celle que la plupart des calculateurs omettent.

Prenez les lettres et distribuez-les en L tas : les positions 1, L+1 et 2L+1 dans le premier tas, les positions 2 et L+2 dans le deuxième, et ainsi de suite. Si L est la vraie longueur de clé, toutes les lettres d'un tas ont été décalées de la même lettre de clé : ce tas est donc un César de l'anglais et garde son inégalité. Si L est faux, chaque tas mélange des lettres décalées de quantités différentes et ressort plat.

L'IC par colonnes, moyenné sur les tas, monte donc à la vraie longueur de clé et à chacun de ses multiples. Parcourir le tableau jusqu'à la première longueur qui saute est la manière classique de trouver une longueur de clé Vigenère, et elle est plus fiable que la formule de Friedman sur des textes réels.

La suite

Si le tableau par colonnes désigne une longueur, l'examen de Kasiski est le deuxième avis naturel : il part des distances entre séquences répétées au lieu des statistiques de lettres, et échoue donc ailleurs. Deux méthodes indépendantes qui s'accordent sur le même nombre valent bien plus que l'une des deux seule.

Une fois la longueur assurée, le solveur Vigenère prendra le texte chiffré, le répartira en ce nombre de colonnes, cassera chacune comme un chiffrement de César et vous rendra le mot-clé et le texte clair.

Questions fréquentes

Qu'est-ce que l'indice de coïncidence ?
C'est la probabilité que deux lettres prises au hasard dans un texte soient la même lettre. Écrit, c'est la somme des n(n-1) sur l'effectif de chaque lettre, divisée par N(N-1) pour l'ensemble du texte. L'anglais tourne autour de 0,066 parce que quelques lettres font l'essentiel du travail ; un alphabet uniforme aléatoire donne 1/26, soit environ 0,0385.
Pourquoi mon nombre diffère-t-il d'un autre calculateur ?
Presque toujours à cause de la normalisation. Certains outils donnent la probabilité brute et d'autres la multiplient par 26, si bien que le même texte se lit 0,0667 ou 1,73. Les deux chiffres sont affichés ici. L'autre cause fréquente est qu'un outil ait compté les espaces ou les chiffres comme des caractères ; celui-ci ne compte que les lettres de A à Z.
Comment l'indice de coïncidence trouve-t-il une longueur de clé ?
À lui seul, il ne la trouve pas. Ce qui la trouve, c'est de répartir le texte chiffré en L colonnes et de mesurer chaque colonne séparément. À la vraie valeur de L, chaque colonne a été chiffrée avec un unique décalage répété : c'est un César de l'anglais, qui garde son IC. Avec un mauvais L, les colonnes sont des mélanges et restent plates. Le tableau par colonnes montre tous les candidats côte à côte.
Qu'est-ce que l'estimation de Friedman et faut-il s'y fier ?
C'est une formule de 1922 qui convertit un IC en longueur de clé approximative. Elle est utile comme vérification à côté du tableau par colonnes, et elle se trompe assez souvent pour ne jamais être utilisée seule, surtout sur des textes courts. Un tiret s'affiche quand votre texte est déjà aussi irrégulier qu'un texte clair, ou trop court pour avoir un IC. La formule suppose qu'une clé répétée a aplati le texte : en dehors de cette plage il n'y a rien à estimer, et tout nombre serait inventé.
Pourquoi 5, 10 et 15 obtiennent-ils tous un bon score ?
Parce qu'une répartition en 10 colonnes coupe en deux les 5 vraies colonnes, et chaque moitié conserve son décalage unique. Tout multiple de la vraie longueur hérite de son score. La réponse est le plus court membre de la famille, et c'est pourquoi la liste de suggestions écarte les multiples.
Peut-il me dire dans quelle langue est un texte ?
Très grossièrement seulement. Le tableau comparatif montre où se situe votre texte par rapport aux valeurs publiées, mais plusieurs langues ont des valeurs proches et un échantillon court bouge plus que les écarts qui les séparent. Servez-vous-en pour distinguer une langue naturelle d'un texte d'allure aléatoire, pas pour trancher entre le français et l'espagnol.
Mon texte quitte-t-il mon navigateur ?
Non. Tout le calcul se fait dans la page. Rien n'est envoyé, journalisé ni stocké où que ce soit.

Outils similaires

Continuez avec ces outils pratiques

Examen de Kasiski

Solveur Vigenère

Analyse de fréquence

Identificateur de chiffre

Solveur de Substitution

Convertisseur de Timestamp Unix