Введение
Изучение частоты букв или групп букв в шифротексте.
В криптоанализе частотный анализ (также известный как подсчёт букв) — это изучение частоты встречаемости букв или групп букв в шифротексте. Этот метод используется как вспомогательное средство для взлома классических шифров. Частотный анализ основан на том факте, что в любом фрагменте письменного текста определённые буквы и их комбинации встречаются с разной частотой. Более того, существует характерное распределение букв, которое примерно одинаково для большинства текстов на данном языке. Например, в английском языке наиболее распространёнными являются буквы , , и , а , , и встречаются редко. Аналогично, наиболее распространёнными парами букв (называемыми биграммами или диграфами) являются , , и , а наиболее распространёнными повторениями – , , и . Бессмысленная фраза "ETAOIN SHRDLU" представляет собой 12 наиболее часто встречающихся букв в типичном английском тексте. В некоторых шифрах подобные свойства исходного текста сохраняются в шифротексте, и эти закономерности могут быть использованы при атаке, основанной только на шифротексте.
Анализ частоты для простых заменных шифров
В простом шифре подстановки каждая буква открытого текста заменяется другой, и любая конкретная буква в открытом тексте всегда будет преобразована в одну и ту же букву в зашифрованном тексте. Например, если все вхождения буквы «А» превращаются в букву «Ж», зашифрованное сообщение, содержащее многочисленные экземпляры буквы «Ж», подскажет криптоаналитику, что «Ж» представляет собой «А». Основное применение частотного анализа заключается в том, чтобы сначала подсчитать частоту букв в зашифрованном тексте, а затем сопоставить с ними предполагаемые буквы открытого текста. Большее количество букв «Е» в зашифрованном тексте, чем каких-либо других, предполагает, что «Е» соответствует «Е» в открытом тексте, но это не точно; буквы «О» и «А» также очень часто встречаются в английском языке, поэтому «Е» может быть любой из них. Маловероятно, что это будет буква «Ы» или «Ь» в открытом тексте, так как они встречаются реже. Таким образом, криптоаналитику может потребоваться попробовать несколько комбинаций соответствий между буквами зашифрованного и открытого текста. Можно использовать более сложный статистический анализ, например, учитывать количество пар букв (биграмм), троек букв (триграмм) и так далее. Это делается для предоставления криптоаналитику больше информации, например, сочетания «TH» почти всегда встречаются вместе в этом порядке в английском языке, хотя сама буква «T» встречается нечасто.
The basic use of frequency analysis is to first count the frequency of ciphertext letters and then associate guessed plaintext letters with them. More s in the ciphertext than anything else suggests that corresponds to in the plaintext, but this is not certain; and are also very common in English, so might be either of them. It is unlikely to be a plaintext or , which are less common. Thus the cryptanalyst may need to try several combinations of mappings between ciphertext and plaintext letters. More complex use of statistics can be conceived, such as considering counts of pairs of letters (bigrams), triplets (trigrams), and so on. This is done to provide more information to the cryptanalyst, for instance, and nearly always occur together in that order in English, even though itself is rare.
Анализ частоты в художественной литературе
Анализ частоты описывался в художественной литературе. «Золотой жук» Эдгара Аллана По и рассказ Артура Конан Дойла о Шерлоке Холмсе «Приключение танцующих человечков» — примеры историй, в которых описывается применение частотного анализа для взлома простых шифров подстановки. Шифр в рассказе По усложнен несколькими вводящими в заблуждение элементами, но это скорее литературный ход, чем что-либо существенно значимое в криптографии.