Введение
Математическая функция, обратная функции ошибок
В теории вероятностей и статистике функция пробита — это квантильная функция, связанная со стандартным нормальным распределением. Она находит применение в анализе данных и машинном обучении, в частности, в разведочной статистической графике и специализированном регрессионном моделировании бинарных переменных отклика. Математически, пробит является обратной функцией кумулятивного распределения стандартного нормального распределения, обозначаемого как Φ, поэтому пробит определяется как
В значительной степени благодаря центральной предельной теореме, стандартное нормальное распределение играет фундаментальную роль в теории вероятностей и статистике. Если мы учтем известный факт, что стандартное нормальное распределение размещает 95% вероятности между −1,96 и 1,96 и симметрично относительно нуля, то следует, что
Функция пробита выполняет «обратное» вычисление, генерируя значение стандартной нормальной случайной величины, соответствующее заданной кумулятивной вероятности. Продолжая пример,
В общем случае,
и
Концептуальная разработка
Идея функции пробита была опубликована Честером Иттнером Блиссом в статье 1934 года в журнале Science, посвященной методам обработки данных, таких как процент вредителей, уничтоженных пестицидом. Блис предложил преобразовать процент уничтоженных особей в "единицу вероятности" (или "пробит"), которая линейно связана с современным определением (он произвольно определил её равной 0 для значения 0,0001 и 1 для значения 0,9999). Он включил таблицу, чтобы помочь другим исследователям преобразовывать их проценты уничтоженных особей в его пробиты, которые затем можно было нанести на график в зависимости от логарифма дозы, и таким образом, как предполагалось, получить более или менее прямую линию. Такая так называемая пробитная модель до сих пор важна в токсикологии, а также в других областях. Этот подход особенно оправдан, если изменчивость реакции может быть объяснена как логнормальное распределение устойчивости среди испытуемых, где устойчивость конкретного испытуемого – это минимальная доза, достаточная для достижения интересующего эффекта. Метод, предложенный Блиссом, был развит в книге D.J. Finney "Probit Analysis" – важном труде, посвященном токсикологическим применениям. Значения, представленные Финни, можно получить из пробитов, определенных здесь, путем добавления значения 5. Это различие суммировано Коллеттом (с. 55): "Первоначальное определение пробита [с добавлением 5] было в основном направлено на то, чтобы избежать работы с отрицательными пробитами; это определение все еще используется в некоторых областях, но в основных пакетах статистического программного обеспечения для пробитного анализа пробиты определяются без добавления 5". Следует отметить, что методология пробитов, включая численную оптимизацию для подгонки функций пробитов, была разработана до широкого распространения электронных вычислительных машин. При использовании таблиц было удобно, чтобы значения пробитов были однозначно положительными. Однако, в большинстве практических приложений положительные значения пробитов не требуются.
He included a table to aid other researchers to convert their kill percentages to his probit, which they could then plot against the logarithm of the dose and thereby, it was hoped, obtain a more or less straight line. Such a so called probit model is still important in toxicology, as well as other fields. The approach is justified in particular if response variation can be rationalized as a lognormal distribution of tolerances among subjects on test, where the tolerance of a particular subject is the dose just sufficient for the response of interest. The method introduced by Bliss was carried forward in Probit Analysis, an important text on toxicological applications by D. J. Finney. Values tabled by Finney can be derived from probits as defined here by adding a value of 5. This distinction is summarized by Collett (p. 55): "The original definition of a probit [with 5 added] was primarily to avoid having to work with negative probits; This definition is still used in some quarters, but in the major statistical software packages for what is referred to as probit analysis, probits are defined without the addition of 5." It should be observed that probit methodology, including numerical optimization for fitting of probit functions, was introduced before widespread availability of electronic computing. When using tables, it was convenient to have probits uniformly positive. Common areas of application do not require positive probits.
Диагностика отклонения распределения от нормы
Помимо того, что функция пробита служит основой для важных типов регрессии, она полезна в статистическом анализе для диагностики отклонений от нормальности с помощью метода Q–Q-графиков. Если набор данных действительно представляет собой выборку из нормального распределения, график значений, построенный относительно их пробитных квантилей, будет приблизительно линейным. Специфические отклонения от нормальности, такие как асимметрия, тяжелые хвосты или бимодальность, можно диагностировать, выявляя конкретные отклонения от линейности. Хотя Q–Q-график можно использовать для сравнения с любой семейством распределений (а не только с нормальным), нормальный Q–Q-график является относительно стандартной процедурой разведочного анализа данных, поскольку предположение о нормальности часто является исходной точкой анализа.
Вычисления
Функция распределения нормального распределения (CDF) и ее обратная функция не имеют аналитического выражения в замкнутой форме, и для вычисления требуется аккуратное использование численных методов. Однако эти функции широко доступны в программном обеспечении для статистического анализа и вероятностного моделирования, а также в табличных процессорах. Например, в Microsoft Excel функция пробита доступна как NORM.S.INV(p). В вычислительных средах, где доступны численные реализации обратной функции ошибок, функция пробита может быть получена как
Пример – MATLAB, где доступна функция "erfinv". Язык Mathematica реализует "InverseErf". Другие среды непосредственно реализуют функцию пробита, как показано в следующем примере сессии в языке программирования R: > qnorm(0.025)
[1] 1.959964
> pnorm(1.96)
[1] 0.02499790
[1] 1.959964
> pnorm( 1.96)
[1] 0.02499790
Подробную информацию о вычислении обратной функции ошибок можно найти в работе Wichura, где представлен быстрый алгоритм вычисления функции пробита с точностью до 16 знаков после запятой; этот алгоритм используется в R для генерации случайных величин, подчиняющихся нормальному распределению.