Введение

Как часто идентичные буквы встречаются в одной и той же позиции в двух текстах.

В криптографии подсчет совпадений — это метод (изобретенный Уильямом Ф. Фридманом), который заключается в сопоставлении двух текстов и подсчете количества случаев, когда идентичные буквы оказываются в одной и той же позиции в обоих текстах. Этот показатель, выраженный либо как отношение к общему числу, либо нормализованный путем деления на ожидаемое значение для случайной модели источника, известен как индекс совпадения, или сокращенно IC. Поскольку буквы в естественном языке распределены неравномерно, IC для таких текстов выше, чем для равномерно случайных строк. Особенно полезно то, что значение IC не изменяется, если оба текста зашифрованы одним и тем же шифром подстановки, что позволяет криптоаналитику быстро определить, что использовался именно этот вид шифрования.

Обобщение

Вышеприведенное описание является лишь введением в использование индекса совпадения, который связан с общей концепцией корреляции. Разработаны различные формы индекса совпадения; "дельта" И.С. (определяемый формулой выше) фактически измеряет автокорреляцию одного распределения, в то время как "каппа" И.С. используется при сопоставлении двух текстовых строк. Хотя в некоторых приложениях постоянные факторы, такие как и , могут быть проигнорированы, в более общих ситуациях имеет большое значение приведение каждого И.С. к значению, ожидаемому для нулевой гипотезы (обычно: отсутствие совпадений и равномерное случайное распределение символов), так чтобы в любой ситуации ожидаемое значение при отсутствии корреляции составляло 1,0. Таким образом, любая форма И.С. может быть выражена как отношение числа фактически наблюдаемых совпадений к числу ожидаемых совпадений (согласно нулевой модели), с учетом конкретной схемы тестирования. Из вышесказанного легко увидеть, что формула для каппа И.С. имеет вид:

где – общая длина выравнивания двух текстов A и B, а выражение в скобках равно 1, если -я буква текста A совпадает с -й буквой текста B, и 0 в противном случае. Связанное понятие, "выпуклость" распределения, измеряет расхождение между наблюдаемым И.С. и нулевым значением 1,0. Количество шифровых алфавитов, используемых в полиалфавитном шифре, можно оценить, разделив ожидаемую выпуклость дельта И.С. для одного алфавита на наблюдаемую выпуклость для сообщения, хотя во многих случаях (например, при использовании повторяющегося ключа) существуют более эффективные методы.