Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Дискретное распределение вероятности
Discrete probability distribution
В теории вероятностей и статистике закон Зипфа — Мандельброта является дискретным распределением вероятности. Также известный как закон Парето — Зипфа, это распределение степенного закона для ранжированных данных, названное в честь лингвиста Джорджа Кингсли Зипфа, который предложил более простое распределение, называемое законом Зипфа, и математика Бенуа Мандельброта, который впоследствии его обобщил. Функция массы вероятности задается следующим образом:
In probability theory and statistics, the Zipf–Mandelbrot law is a discrete probability distribution. Also known as the Pareto–Zipf law, it is a power law distribution on ranked data, named after the linguist George Kingsley Zipf who suggested a simpler distribution called Zipf's law, and the mathematician Benoit Mandelbrot, who subsequently generalized it. The probability mass function is given by:
где задается следующим образом:
where is given by:
что можно рассматривать как обобщение гармонического числа. В формуле — ранг данных, а и — параметры распределения. В пределе, когда стремится к бесконечности, это переходит в дзета-функцию Гурвица. При конечных и закон Зипфа — Мандельброта становится законом Зипфа. При бесконечных и он становится дзета-распределением.
which may be thought of as a generalization of a harmonic number. In the formula, is the rank of the data, and and are parameters of the distribution. In the limit as approaches infinity, this becomes the Hurwitz zeta function For finite and the Zipf–Mandelbrot law becomes Zipf's law. For infinite and it becomes a Zeta distribution.
Приложения
Распределение слов, ранжированных по частоте в случайном текстовом корпусе, аппроксимируется распределением степенного закона, известным как закон Зипфа. Если построить график частотного ранга слов, содержащихся в корпусе текста умеренного размера, в зависимости от количества появлений или фактической частоты, то получится распределение степенного закона с показателем степени, близким к единице (но см. Powers, 1998 и Gelbukh & Sidorov, 2001). Закон Зипфа неявно предполагает фиксированный размер словарного запаса, однако гармонический ряд при s=1 не сходится, а обобщение Зипфа — Мандельброта при s>1 сходится. Более того, существуют данные, свидетельствующие о том, что замкнутый класс служебных слов, определяющих язык, подчиняется распределению Зипфа — Мандельброта с параметрами, отличными от параметров открытых классов содержательных слов, которые варьируются в зависимости от темы, области и стиля. В экологических полевых исследованиях часто обнаруживается, что распределение относительной численности (то есть график количества наблюдаемых видов в зависимости от их численности) соответствует закону Зипфа — Мандельброта. В музыке многие метрики оценки "приятной" музыки соответствуют распределению Зипфа — Мандельброта.
The distribution of words ranked by their frequency in a random text corpus is approximated by a power law distribution, known as Zipf's law. If one plots the frequency rank of words contained in a moderately sized corpus of text data versus the number of occurrences or actual frequencies, one obtains a power law distribution, with exponent close to one (but see Powers, 1998 and Gelbukh & Sidorov, 2001). Zipf's law implicitly assumes a fixed vocabulary size, but the Harmonic series with s=1 does not converge, while the Zipf–Mandelbrot generalization with s>1 does. Furthermore, there is evidence that the closed class of functional words that define a language obeys a Zipf–Mandelbrot distribution with different parameters from the open classes of contentive words that vary by topic, field and register. In ecological field studies, the relative abundance distribution (i. e. the graph of the number of species observed as a function of their abundance) is often found to conform to a Zipf–Mandelbrot law. Within music, many metrics of measuring "pleasing" music conform to Zipf–Mandelbrot distributions.