Введение
График эмпирического распределения p-значений по сравнению с теоретическим.
В статистике Q–Q-график (квантиль-квантиль-график) — это график вероятностей, графический метод сравнения двух распределений вероятностей путем нанесения их квантилей друг на друга. Точка (x, y) на графике соответствует одному из квантилей второго распределения (координата y), сопоставленному с тем же квантилем первого распределения (координата x). Это определяет параметрическую кривую, где параметр — индекс квантильного интервала. Если сравниваемые распределения схожи, точки на Q–Q-графике будут приблизительно лежать на прямой линии единичного наклона. Если распределения линейно связаны, точки на Q–Q-графике будут приблизительно лежать на прямой, но не обязательно на линии единичного наклона. Q–Q-графики также могут использоваться как графический способ оценки параметров в семействе распределений с параметрами местоположения и масштаба. Q–Q-график используется для сравнения формы распределений, предоставляя графическое представление о том, как свойства, такие как местоположение, масштаб и асимметрия, схожи или различны в двух распределениях. Q–Q-графики могут использоваться для сравнения наборов данных или теоретических распределений. Использование Q–Q-графиков для сравнения двух выборок данных можно рассматривать как непараметрический подход к сравнению их базовых распределений. Q–Q-график, как правило, более информативен, чем сравнение гистограмм выборок, но менее известен. Q–Q-графики обычно используются для сравнения набора данных с теоретической моделью. Выбросы видны в правом верхнем углу. Q–Q-график — это график квантилей двух распределений друг против друга или график, основанный на оценках квантилей. Расположение точек на графике используется для сравнения двух распределений. Основным этапом построения Q–Q-графика является вычисление или оценка квантилей, которые будут отображены на графике. Если одна или обе оси на Q–Q-графике основаны на теоретическом распределении с непрерывной кумулятивной функцией распределения (CDF), все квантили однозначно определены и могут быть получены путем инвертирования CDF. Если теоретическое распределение вероятностей с разрывной CDF является одним из двух сравниваемых распределений, некоторые квантили могут быть не определены, поэтому может быть нанесен интерполированный квантиль. Если Q–Q-график основан на данных, используется несколько оценок квантилей. Правила построения Q–Q-графиков, когда квантили необходимо оценивать или интерполировать, называются позициями построения графика. Простой случай — когда есть два набора данных одинакового размера. В этом случае, чтобы построить Q–Q-график, каждый набор упорядочивается по возрастанию, затем соответствующие значения объединяются в пары и наносятся на график. Более сложный случай — сравнение двух наборов данных разного размера. Для построения Q–Q-графика в этом случае необходимо использовать интерполированную оценку квантилей, чтобы можно было построить квантили, соответствующие одной и той же базовой вероятности. Более абстрактно, заданы две кумулятивные функции распределения вероятностей F и G с соответствующими квантильными функциями F⁻¹ и G⁻¹ (обратная функция CDF является квантильной функцией), Q–Q-график отображает q-й квантиль F против q-го квантиля G для диапазона значений q. Таким образом, Q–Q-график представляет собой параметрическую кривую, индексированную на [0,1] со значениями в реальной плоскости R².
Интерпретация
Точки, нанесенные на Q–Q-графике, всегда неубывают при просмотре слева направо. Если два сравниваемых распределения идентичны, Q–Q-график следует линии под углом 45°. Если два распределения согласуются после линейного преобразования значений в одном из них, Q–Q-график следует некоторой линии, но не обязательно линии . Если общая тенденция Q–Q-графика более пологая, чем линия , распределение, представленное на горизонтальной оси, более разбросано, чем распределение, представленное на вертикальной оси. И наоборот, если общая тенденция Q–Q-графика круче, чем линия , распределение, представленное на вертикальной оси, более разбросано, чем распределение, представленное на горизонтальной оси. Q–Q-графики часто имеют изогнутую или S-образную форму, что указывает на то, что одно из распределений более скошено, чем другое, или что одно из распределений имеет более тяжелые хвосты. Хотя Q–Q-график основан на квантилях, в стандартном Q–Q-графике невозможно определить, какая точка на графике соответствует данному квантилю. Например, невозможно определить медиану ни одного из двух сравниваемых распределений, просто просмотрев Q–Q-график. Некоторые Q–Q-графики показывают децили, чтобы сделать такие определения возможными. Пересечение и наклон линейной регрессии между квантилями дают меру относительного положения и относительного масштаба выборок. Если медиана распределения, представленного на горизонтальной оси, равна 0, то пересечение регрессионной линии является мерой положения, а наклон – мерой масштаба. Расстояние между медианами – еще одна мера относительного положения, отраженная на Q–Q-графике. "Коэффициент корреляции вероятностного графика" (PPCC) – это коэффициент корреляции между парными квантилями выборки. Чем ближе коэффициент корреляции к единице, тем ближе распределения к сдвинутым и масштабированным версиям друг друга. Для распределений с одним параметром формы график коэффициента корреляции вероятностного графика предоставляет метод оценки этого параметра формы – достаточно вычислить коэффициент корреляции для различных значений параметра формы и использовать тот, который обеспечивает наилучшее соответствие, как если бы сравнивались распределения разных типов. Другое распространенное применение Q–Q-графиков – сравнение распределения выборки с теоретическим распределением, например, со стандартным нормальным распределением N(0,1), как в случае графика нормальной вероятности. Как и при сравнении двух выборок данных, данные упорядочиваются (формально вычисляются статистики порядка), а затем наносятся на график в зависимости от определенных квантилей теоретического распределения.
Позиции на графике
Выбор квантилей из теоретического распределения может зависеть от контекста и цели. Один из вариантов, при наличии выборки размера n, – это k / n, поскольку это те квантили, которые реализуются в распределении выборки. Последний из них, n / n, соответствует 100-му процентилю – максимальному значению теоретического распределения, которое иногда может быть бесконечным. Другие варианты включают использование (k − 0,5) / n или размещение n точек на равном расстоянии друг от друга, а также между двумя крайними точками и границами интервала, используя k / (n + 1). Было предложено множество других вариантов, как формальных, так и эвристических, основанных на теории или моделировании, релевантных для конкретного контекста. В следующих разделах рассматриваются некоторые из них. Более узкий вопрос – выбор максимума (оценка максимального значения в генеральной совокупности), известный как «немецкая танковая проблема», для которой существуют аналогичные решения вида «максимум выборки плюс поправка», наиболее просто выражаемые как m + m/n − 1. Более формальное применение равномерного распределения точек используется в методе оценки максимального интервала между параметрами.
Ожидаемое значение статистики ордеров для равномерного распределения
Подход k / (n + 1) эквивалентен построению графика точек в соответствии с вероятностью того, что последнее из (n + 1) случайно выбранных значений не превысит k-е наименьшее из первых n случайно выбранных значений.
Ожидаемое значение статистики порядка для стандартного нормального распределения
При использовании нормального графика вероятности, квантили, которые применяются, – это рангиты, квантили ожидаемого значения статистики порядка стандартного нормального распределения. В более общем случае, тест Шапиро — Уилка использует ожидаемые значения статистики порядка заданного распределения; полученный график и линия позволяют получить оценку обобщенных наименьших квадратов для параметров местоположения и масштаба (на основе пересечения и наклона аппроксимирующей прямой). Хотя это не имеет большого значения для нормального распределения (параметры местоположения и масштаба оцениваются соответственно средним и стандартным отклонением), это может быть полезно для многих других распределений. Однако для этого требуется вычисление ожидаемых значений статистики порядка, что может быть сложной задачей, если распределение не является нормальным.
Медиана статистики порядка
В качестве альтернативы можно использовать оценки медианы статистики упорядочения, которые можно вычислить на основе оценок медианы статистики упорядочения равномерного распределения и квантильной функции распределения; это было предложено формулами (k - 0,3175) / (n + 0,365), (k - 0,326) / (n + 0,348), (k - 1/3) / (n + 1/3). Простая (и легко запоминающаяся) формула для определения позиций при построении графиков; используется в статистическом пакете BMDP. Также использовались формулы (k - 0,375) / (n + 0,25), (k - 0,4) / (n + 0,2), (k - 0,44) / (n + 0,12). Данное положение на графике использовалось Ирвингом И. Грингортеном при проверке соответствия распределению Гамбеля. Кроме того, применялась формула (k - 0,5) / n, (k - 0,567) / (n - 0,134) и (k - 1) / (n - 1). При большом размере выборки, n, разница между этими выражениями незначительна.
(k − 0.567) / (n − 0.134). (k − 1) / (n − 1). For large sample size, n, there is little difference between these various expressions.
Оценка Filliben
Медианы статистик порядка – это медианы статистик порядка распределения. Их можно выразить через квантильную функцию и медианы статистик порядка для непрерывного равномерного распределения следующим образом:
где U(i) – медианы статистик порядка для равномерного распределения, а G – квантильная функция для целевого распределения. Квантильная функция является обратной к функции кумулятивного распределения (вероятности того, что X меньше или равно некоторому значению). Иными словами, зная вероятность, мы хотим найти соответствующий квантиль функции кумулятивного распределения. Джеймс Дж. Филлибен использует следующие оценки для медиан статистик порядка равномерного распределения:
Причина использования этой оценки заключается в том, что медианы статистик порядка не имеют простого выражения.
Программное обеспечение
Язык программирования R включает в себя функции для создания Q–Q графиков, а именно `qqnorm` и `qqplot` из пакета. Пакет обеспечивает более быстрое построение графиков для большого объема данных.