T

Text Machine

Potentes herramientas de texto, en tu navegador

Calculadora del Índice de Coincidencia

Mide lo desigual que es el reparto de letras de un texto y lee la longitud de la clave directamente en la tabla por columnas.

Prueba:

Texto

Pega un texto para medirlo. Las muestras de César y de Vigenère son el mismo pasaje que la inglesa, así que puedes ver qué le hace cada tipo de cifrado al número.

Cómo usar Calculadora del Índice de Coincidencia

  1. 1

    Pega el texto

    Suelta texto llano o cifrado en el cuadro. Solo participan las letras de la A a la Z; se ignoran mayúsculas, espacios, dígitos y puntuación, así que el formato no puede mover el número.

  2. 2

    Lee el índice

    El IC en bruto es la probabilidad de que dos letras tomadas al azar sean la misma letra. La cifra normalizada es ese valor frente a un alfabeto uniforme, donde 1,00 es azar y alrededor de 1,73 es inglés.

  3. 3

    Decide qué clase de cifrado tienes

    Alrededor de 0,066 significa que el reparto de letras está intacto, así que es texto llano o una sustitución simple. Alrededor de 0,038 significa que se ha aplanado, lo que apunta a un cifrado de clave repetida.

  4. 4

    Halla la longitud en la tabla por columnas

    Si el texto parece polialfabético, busca la longitud más corta cuyo IC por columnas vuelva a subir hacia 0,066. Esa es la longitud de la clave, y es el número que necesita el solucionador Vigenère.

El índice de coincidencia, explicado

Un número, una pregunta

El índice de coincidencia responde a una pregunta estrecha: si metes la mano en un texto dos veces y sacas una letra cada vez, ¿con qué frecuencia sacas la misma letra dos veces? En una bolsa con 26 letras igual de comunes la respuesta es 1 entre 26, unos 0,0385. En inglés es casi el doble, unos 0,066, porque el inglés no es una bolsa pareja. La E, la T, la A y la O hacen una cantidad enorme del trabajo y la J, la Q, la X y la Z apenas aparecen.

Esa diferencia es toda la utilidad del estadístico. Sobrevive al cambio de etiquetas: si cambias cada A por una Q y cada Q por una A, los recuentos se mueven pero la desigualdad no, así que el índice no varía. No sobrevive a repartirse entre varios alfabetos, que es exactamente lo que hace un cifrado de clave repetida.

Lo que puede y lo que no puede decirte

Un IC cercano a 0,066 dice que el reparto de letras está intacto. Eso incluye texto llano corriente, un desplazamiento César, un espejo Atbash y cualquier sustitución simple, y es la razón de que un cifrado monoalfabético se rompa con análisis de frecuencias y no con este número.

Un IC cercano a 0,038 dice que el reparto se ha aplanado. Algo está asignando una letra del texto llano a varias letras cifradas, que es la firma de Vigenère y sus parientes, o de una cadena genuinamente aleatoria.

Una lectura intermedia suele significar que el texto es demasiado corto, no que el cifrado sea raro. Por debajo de unas cien letras el índice se mueve lo bastante como para engañar, y por debajo de unas trescientas conviene tratarlo como pista y no como veredicto.

La tabla por columnas es la parte que hace el trabajo

El número único del texto completo te dice la clase de cifrado. Hallar la longitud de la clave exige un segundo paso, y es el paso que la mayoría de calculadoras se salta.

Toma las letras y repártelas en L montones: las posiciones 1, L+1 y 2L+1 al primer montón; las posiciones 2 y L+2 al segundo, y así. Si L es la longitud real de la clave, todas las letras de un montón se desplazaron con la misma letra de clave, así que ese montón es un César del inglés y conserva su desigualdad. Si L es errónea, cada montón mezcla letras desplazadas cantidades distintas y sale plano.

Por eso el IC por columnas, promediado entre los montones, sube en la longitud verdadera y en todos sus múltiplos. Recorrer la tabla buscando la primera longitud que salta es la forma clásica de hallar una longitud de clave Vigenère, y es más fiable que la fórmula de Friedman con textos reales.

Adónde ir después

Si la tabla por columnas apunta a una longitud, el examen de Kasiski es la segunda opinión natural: parte de las distancias entre secuencias repetidas en lugar de la estadística de letras, así que falla en sitios distintos. Que dos métodos independientes coincidan en el mismo número es una prueba mucho más fuerte que cualquiera de los dos por separado.

Cuando tengas confianza en la longitud, el solucionador Vigenère tomará el texto cifrado, lo repartirá en ese número de columnas, romperá cada una como un cifrado César y te devolverá la palabra clave y el texto llano.

Preguntas frecuentes

¿Qué es el índice de coincidencia?
Es la probabilidad de que dos letras tomadas al azar de un texto resulten ser la misma letra. Escrito, es la suma de n(n-1) sobre el recuento de cada letra, dividida entre N(N-1) para el texto completo. El inglés ronda 0,066 porque unas pocas letras hacen casi todo el trabajo; un alfabeto uniforme al azar da 1/26, es decir, unos 0,0385.
¿Por qué mi número difiere del de otra calculadora?
Casi siempre por la normalización. Algunas herramientas dan la probabilidad en bruto y otras la multiplican por 26, así que el mismo texto se lee como 0,0667 o como 1,73. Aquí se muestran ambas cifras. La otra causa habitual es que la herramienta contara espacios o dígitos como caracteres; esta cuenta solo letras de la A a la Z.
¿Cómo halla el índice de coincidencia una longitud de clave?
Por sí solo, no la halla. Lo que la halla es repartir el texto cifrado en L columnas y medir cada columna por separado. En la L verdadera cada columna se cifró con un único desplazamiento repetido, así que es un César del inglés y conserva su IC. Con una L equivocada las columnas son mezclas y se quedan planas. La tabla por columnas muestra todos los candidatos en paralelo.
¿Qué es la estimación de Friedman y debo fiarme de ella?
Es una fórmula de 1922 que convierte un IC en una longitud de clave aproximada. Sirve como comprobación junto a la tabla por columnas y se equivoca lo bastante a menudo como para no usarla sola, sobre todo con textos cortos. Aparece un guion cuando tu texto ya es tan irregular como el texto plano, o demasiado corto para tener un IC. La fórmula da por supuesto que una clave repetida ha aplanado el texto: fuera de ese rango no hay nada que estimar y cualquier número sería inventado.
¿Por qué puntúan bien 5, 10 y 15 a la vez?
Porque repartir en 10 columnas es partir en dos las 5 columnas reales, y cada mitad conserva su único desplazamiento. Todo múltiplo de la longitud verdadera hereda su puntuación. La respuesta es el miembro más corto de la familia, y por eso la lista de sugerencias descarta los múltiplos.
¿Puede decirme en qué idioma está un texto?
Solo de forma muy aproximada. La tabla comparativa muestra dónde queda tu texto frente a las cifras publicadas, pero varios idiomas tienen valores parecidos y una muestra corta se mueve más que las distancias entre ellos. Úsalo para separar lengua natural de texto con aspecto aleatorio, no para elegir entre francés y español.
¿Mi texto sale de mi navegador?
No. Todo el cálculo se hace en la página. Nada se sube, se registra ni se guarda en ningún sitio.

Herramientas relacionadas

Sigue trabajando con estas prácticas herramientas

Examen de Kasiski

Solucionador de Vigenère

Análisis de frecuencia

Identificador de cifrado

Solucionador de Sustitución

Convertidor de Timestamp Unix