Введение
Функциональная зависимость между двумя величинами
В статистике степенной закон — это функциональная зависимость между двумя величинами, при которой относительное изменение одной величины приводит к относительному изменению другой величины, пропорциональному степени этого изменения, независимо от начальных значений этих величин: одна величина изменяется как степень другой. Например, если рассматривать площадь квадрата в зависимости от длины его стороны, то при удвоении длины площадь увеличивается в четыре раза. Скорость изменения, наблюдаемая в таких зависимостях, называется мультипликативной.
Эмпирические примеры
Распределение широкого спектра физических, биологических и созданных человеком явлений приблизительно подчиняется степенному закону в широком диапазоне значений: к ним относятся размеры кратеров на Луне и солнечных вспышек, модели поиска пищи различных видов, размеры паттернов активности нейронных популяций, частоты слов в большинстве языков, частоты фамилий, видовое богатство в кладах организмов, масштабы отключений электроэнергии, извержения вулканов, субъективные оценки человеком интенсивности стимулов и многие другие величины. Эмпирические распределения могут соответствовать степенному закону лишь в ограниченном диапазоне значений, поскольку чистый степенной закон допускал бы произвольно большие или малые значения. Затухание звука подчиняется степенным законам зависимости от частоты в широких частотных диапазонах для многих сложных сред. Аллометрические законы масштабирования, описывающие взаимосвязи между биологическими переменными, являются одними из наиболее известных степенных функций в природе.
Инвариантность шкалы
Одним из атрибутов степенных законов является их масштабная инвариантность. Для заданного соотношения масштабирование аргумента на постоянный фактор приводит лишь к пропорциональному масштабированию самой функции. То есть,
где обозначает прямую пропорциональность. Иными словами, масштабирование на постоянную просто умножает исходное степенное соотношение на эту постоянную. Следовательно, все степенные законы с одним и тем же показателем степени эквивалентны с точностью до постоянных множителей, поскольку каждый из них является лишь масштабированной версией другого. Именно это поведение приводит к линейной зависимости при взятии логарифмов от обеих переменных, и прямая линия на графике в логарифмических координатах часто называется "подписью" степенного закона. При работе с реальными данными такая линейность является необходимым, но недостаточным условием для соответствия данных степенному закону. Фактически, существует множество способов сгенерировать конечное количество данных, имитирующих такое поведение, но не являющихся истинными степенными законами в асимптотическом пределе. Таким образом, точное подгонка и валидация моделей степенных законов – активная область исследований в статистике; см. ниже.
Отсутствие четко определенного среднего значения
Закон степенного распределения имеет чётко определённое среднее значение только если α > 1, а конечную дисперсию – только если α > 2. Большинство выявленных в природе законов степенного распределения имеют показатели, при которых среднее значение определено, но дисперсия – нет, что указывает на их способность к проявлению "чёрных лебедей". Представьте себе комнату с вашими друзьями и попробуйте оценить их средний ежемесячный доход. Теперь представьте, что в комнату входит самый богатый человек в мире с ежемесячным доходом около 1 миллиарда долларов США. Что произойдёт со средним доходом в комнате? Доход распределён в соответствии с законом степенного распределения, известным как распределение Парето (например, чистое состояние американцев распределено по закону степенного распределения с показателем 2). С одной стороны, это делает некорректным применение традиционной статистики, основанной на дисперсии и стандартном отклонении (например, регрессионного анализа). С другой стороны, это позволяет проводить экономически эффективные вмешательства. Однако медиана существует: для закона степенного распределения x ~ k⁻α, с показателем α > 1, она равна 2¹/(α-1) * xmin, где xmin – минимальное значение, для которого выполняется закон степенного распределения. Среди них:
Экономика
Размеры населения городов в регионе или городской сети, закон Ципфа. Распределение художников по средней цене их работ. Распределение доходов в рыночной экономике. Распределение степеней в банковских сетях. Распределение размеров фирм.
Неплохо нарушил закон энергии
Части сломанного степенного закона можно плавно соединить, чтобы построить плавно сломанный степенной закон. Существуют различные способы соединения степенных законов. Один из примеров следующий: когда функция отображается в логарифмическом масштабе по обеим осям, где горизонтальная ось – , а вертикальная ось – , график состоит из линейных сегментов с наклонами , разделенных в точке , плавно соединенных между собой. Величина определяет плавность перехода между сегментами .
When the function is plotted as a log log plot with horizontal axis being and vertical axis being , the plot is composed of linear segments with slopes , separated at , smoothly spliced together. The size of determines the sharpness of splicing between segments .
Графические методы идентификации
Хотя были предложены более сложные и надежные методы, наиболее часто используемыми графическими методами для выявления распределений вероятностей, подчиняющихся закону степени, при использовании случайных выборок являются паретовские квантиль-квантильные графики (или паретовские QQ-графики), графики среднего остаточного времени жизни и логарифмические графики (лог-лог графики). Другой, более устойчивый графический метод использует пучки функций остаточных квантилей. (Следует помнить, что распределения, подчиняющиеся закону степени, также называются распределениями типа Парето.) Здесь предполагается, что случайная выборка получена из распределения вероятностей, и необходимо определить, следует ли хвосту распределения закону степени (иными словами, имеет ли распределение "паретовский хвост"). В дальнейшем случайная выборка будет называться "данными". Паретовские QQ-графики сравнивают квантили логарифмически преобразованных данных с соответствующими квантилями экспоненциального распределения со средним значением 1 (или с квантилями стандартного распределения Парето), отображая первые относительно вторых. Если полученная диаграмма рассеяния показывает, что построенные точки "асимптотически сходятся" к прямой линии, то следует заподозрить распределение, подчиняющееся закону степени. Ограничением паретовских QQ-графиков является их плохая работа при значениях показателя хвоста (также называемого индексом Парето), близких к 0, поскольку они не предназначены для выявления распределений с медленно меняющимися хвостами. Логарифмические графики (лог-лог графики) представляют собой альтернативный способ графического анализа хвоста распределения с использованием случайной выборки. Однако следует соблюдать осторожность, поскольку лог-лог график является необходимым, но недостаточным доказательством связи, подчиняющейся закону степени, так как многие распределения, не подчиняющиеся закону степени, будут выглядеть как прямые линии на лог-лог графике. Этот метод заключается в построении графика логарифма оценки вероятности появления конкретного значения распределения в зависимости от логарифма этого значения. Обычно эта оценка представляет собой долю случаев, когда это значение встречается в наборе данных. Если точки на графике имеют тенденцию "сходиться" к прямой линии при больших значениях по оси x, то исследователь заключает, что распределение имеет хвост, подчиняющийся закону степени. Примеры применения этих типов графиков были опубликованы. Недостатком этих графиков является то, что для получения надежных результатов требуется большой объем данных. Кроме того, они подходят только для дискретных (или сгруппированных) данных. Был предложен другой графический метод для выявления распределений вероятностей, подчиняющихся закону степени, с использованием случайных выборок, который обеспечивает полную характеристику поведения хвоста многих известных распределений вероятностей, включая распределения, подчиняющиеся закону степени, распределения с другими типами тяжелых хвостов и даже распределения без тяжелых хвостов. Пучковые графики не имеют недостатков паретовских QQ-графиков, графиков среднего остаточного времени жизни и лог-лог графиков, упомянутых выше (они устойчивы к выбросам, позволяют визуально идентифицировать законы степени при малых значениях и не требуют сбора большого количества данных). Кроме того, с помощью пучковых графиков можно выявлять и другие типы поведения хвоста.
Графическое изображение распределения законов силы
В целом, распределения степенного закона обычно изображаются на двойных логарифмических осях, что акцентирует внимание на верхней хвостовой части. Наиболее удобный способ сделать это – использовать (дополнительную) кумулятивную функцию распределения (ccdf), то есть функцию выживания, .
Кумулятивная функция распределения (cdf) также является степенной функцией, но с меньшим показателем масштабирования. Для эмпирических данных эквивалентным представлением cdf является рангово-частотный подход, при котором сначала упорядочивают наблюдаемые значения по возрастанию и строят график их зависимости от вектора . Хотя может быть удобно логарифмически бинировать данные или иным образом сглаживать функцию плотности (массы) вероятности напрямую, эти методы вносят скрытую систематическую ошибку в представление данных и, следовательно, их следует избегать. Функция выживания, напротив, более устойчива (но не полностью) к таким искажениям в данных и сохраняет линейный характер на двойных логарифмических осях. Несмотря на то, что представление в виде функции выживания предпочтительнее представления функции плотности вероятности (pdf) при подгонке степенного закона к данным методом наименьших квадратов, оно не лишено математической неточности. Поэтому при оценке показателей степенного закона рекомендуется использовать метод максимального правдоподобия.
Although it can be convenient to log bin the data, or otherwise smooth the probability density (mass) function directly, these methods introduce an implicit bias in the representation of the data, and thus should be avoided. The survival function, on the other hand, is more robust to (but not without) such biases in the data and preserves the linear signature on doubly logarithmic axes. Though a survival function representation is favored over that of the pdf while fitting a power law to the data with the linear least square method, it is not devoid of mathematical inaccuracy. Thus, while estimating exponents of a power law distribution, maximum likelihood estimator is recommended.
Оценка показателя на основе эмпирических данных
Существует множество способов оценки значения показателя масштабирования для степенного хвоста, однако не все они дают несмещенные и непротиворечивые результаты. Некоторые из наиболее надежных методов часто основаны на методе максимального правдоподобия. Альтернативные методы часто используют линейную регрессию по логарифмическим вероятностям, логарифмической кумулятивной функции распределения или по данным, сгруппированным логарифмически, но от этих подходов следует воздержаться, поскольку они могут приводить к сильно искаженным оценкам показателя масштабирования.