Введение
Распределение вероятности
В теории вероятностей и статистике нормальное распределение, или распределение Гаусса, — это тип непрерывного распределения вероятностей для случайной величины, принимающей действительные значения. Общая форма его функции плотности вероятности имеет вид
Параметр μ является математическим ожиданием (средним значением) распределения (а также его медианой и модой), а параметр σ — его стандартным отклонением. Дисперсия распределения равна σ². Случайная величина, имеющая гауссово распределение, называется нормально распределённой и называется нормальным девиатом. Нормальные распределения играют важную роль в статистике и часто используются в естественных и социальных науках для представления случайных величин, принимающих действительные значения, распределения которых неизвестны. Их важность частично обусловлена центральной предельной теоремой. Она утверждает, что при определенных условиях среднее значение большого числа выборок (наблюдений) случайной величины с конечным математическим ожиданием и дисперсией само является случайной величиной, распределение которой стремится к нормальному распределению с увеличением числа выборок. Следовательно, физические величины, которые представляются суммой множества независимых процессов, такие как ошибки измерений, часто имеют распределения, близкие к нормальному. Кроме того, гауссовы распределения обладают уникальными свойствами, которые полезны в аналитических исследованиях. Например, любая линейная комбинация фиксированного набора независимых нормальных девиатов является нормальным девиатом. Многие результаты и методы, такие как распространение неопределённостей и метод наименьших квадратов для подгонки параметров, могут быть получены аналитически в явном виде, когда соответствующие переменные нормально распределены. Нормальное распределение иногда неформально называют кривой колокола. Однако многие другие распределения также имеют форму колокола (например, распределение Коши, t-распределение Стьюдента и логистическое распределение). Другие названия см. в разделе «Наименования». Одновариантное распределение вероятностей обобщается для векторов в многомерном нормальном распределении и для матриц в матричном нормальном распределении.
Обозначение
Плотность вероятности стандартного гауссового распределения (стандартное нормальное распределение, со средним равным нулю и единичной дисперсией) часто обозначается греческой буквой φ (фи). Альтернативная форма греческой буквы фи, ϕ (фи), также используется довольно часто. Нормальное распределение часто называют φ или Таким образом, когда случайная величина X нормально распределена со средним μ и стандартным отклонением σ, можно записать:
Свойства
Нормальное распределение – единственное распределение, у которого кумулянты выше второго (то есть отличные от среднего значения и дисперсии) равны нулю. Оно также является непрерывным распределением с максимальной энтропией при заданных среднем значении и дисперсии. Гейри показал, что при условии конечности среднего значения и дисперсии, нормальное распределение – единственное распределение, в котором среднее значение и дисперсия, вычисленные на основе набора независимых случайных выборок, независимы друг от друга. Нормальное распределение является подклассом эллиптических распределений. Нормальное распределение симметрично относительно своего среднего значения и отлично от нуля на всей вещественной прямой. В связи с этим оно может быть неподходящей моделью для переменных, которые по своей природе положительны или сильно скошены, таких как вес человека или цена акции. Такие переменные могут быть лучше описаны другими распределениями, например, логнормальным или распределением Парето. Значение нормального распределения практически равно нулю, когда значение отклоняется от среднего более чем на несколько стандартных отклонений (например, диапазон в три стандартных отклонения охватывает все, кроме 0,27% от общего распределения). Поэтому оно может быть неадекватной моделью, если ожидается значительная доля выбросов – значений, лежащих на большом расстоянии от среднего, – и методы статистического вывода, оптимальные для нормально распределенных переменных, часто становятся крайне ненадежными при применении к таким данным. В этих случаях следует использовать распределение с более тяжелыми хвостами и применять соответствующие робастные методы статистического вывода. Гауссовское распределение принадлежит к семейству стабильных распределений, которые являются предельными для сумм независимых одинаково распределенных случайных величин, независимо от того, конечны ли среднее значение или дисперсия. За исключением гауссовского, которое является предельным случаем, все стабильные распределения имеют тяжелые хвосты и бесконечную дисперсию. Это одно из немногих распределений, которые являются стабильными и имеют функции плотности вероятности, выражаемые аналитически; к ним же относятся распределение Коши и распределение Леви.
Оператор и класс Stein
В рамках метода Штейна оператор Штейна и класс случайной величины — это оператор Штейна и класс всех абсолютно непрерывных функций.
Операции и функции нормальных переменных
[[Файл:Вероятности функций нормальных векторов.png|thumb|right|a: Плотность вероятности функции нормальной случайной величины с параметрами и b: Плотность вероятности функции двух нормальных случайных величин с параметрами , , , , и c: Тепловая карта совместной плотности вероятности двух функций двух коррелированных нормальных случайных величин с параметрами , , , , и d: Плотность вероятности функции 4 независимых стандартных нормальных случайных величин. Они рассчитаны с помощью численного метода трассировки лучей (код MATLAB). В следующих разделах мы рассмотрим некоторые частные случаи.
Операции с двумя независимыми нормальными переменными
Если и – две независимые нормально распределенные случайные величины, со средними значениями и , а стандартными отклонениями и , то их сумма также будет нормально распределена, [доказательство] со средним и дисперсией . В частности, если и – независимые нормальные отклонения с нулевым средним и дисперсией , то и также независимы и нормально распределены, с нулевым средним и дисперсией . Это частный случай тождества поляризации. Если и – две независимые нормальные отклонения со средним и отклонением , а и – произвольные действительные числа, то переменная также нормально распределена со средним и отклонением . Следовательно, нормальное распределение является стабильным (с показателем ). Если и – нормальные распределения, то их нормализованное геометрическое среднее является нормальным распределением с и (см. здесь для визуализации).
Операции с несколькими коррелированными нормальными переменными
Квадратичная форма нормального вектора, то есть квадратичная функция от нескольких независимых или связанных нормальных переменных, является обобщенной хи-квадратной переменной.
Операции с функцией плотности
Разделенное нормальное распределение наиболее точно определяется как объединение масштабированных фрагментов функций плотности различных нормальных распределений с последующим пересчетом плотности, чтобы интеграл от нее был равен единице. Усеченное нормальное распределение получается путем перемасштабирования фрагмента одной функции плотности.
Бесконечная делимость и теорема Крамера
Для любого положительного целого числа *n*, любое нормальное распределение со средним μ и дисперсией σ² является распределением суммы *n* независимых нормальных отклонений, каждое со средним 0 и дисперсией σ²/n. Это свойство называется бесконечной делимостью. И наоборот, если *X* и *Y* – независимые случайные величины, и их сумма *X+Y* имеет нормальное распределение, то обе величины *X* и *Y* должны быть нормальными отклонениями. Этот результат известен как теорема разложения Крэмера и эквивалентен утверждению, что свертка двух распределений является нормальной тогда и только тогда, когда оба распределения нормальны. Теорема Крэмера подразумевает, что линейная комбинация независимых не-гауссовских переменных никогда не будет иметь строго нормальное распределение, хотя она может приближаться к нему сколь угодно близко.
Теорема Бернштейна
Теорема Бернштейна гласит, что если X и Y независимы и U и V также независимы, то и X, и Y обязательно должны иметь нормальное распределение. В более общем виде, если X₁, X₂, ..., Xₙ – независимые случайные величины, то две различные линейные комбинации a₁X₁ + a₂X₂ + ... + aₙXₙ и b₁X₁ + b₂X₂ + ... + bₙXₙ будут независимыми тогда и только тогда, когда все Xᵢ имеют нормальное распределение и Σᵢ aᵢbᵢV(Xᵢ) = 0, где V(Xᵢ) обозначает дисперсию Xᵢ.
Здесь E(X), V(X) и T(X) – это математическое ожидание, дисперсия и третий центральный момент соответственно. Одним из основных практических применений закона Гаусса является моделирование эмпирических распределений многих различных случайных величин, встречающихся на практике. В таком случае возможным расширением будет более широкое семейство распределений, имеющее более двух параметров и, следовательно, способное более точно аппроксимировать эмпирическое распределение. Примерами таких расширений являются: распределение Пирсона – семейство распределений вероятностей с четырьмя параметрами, расширяющее нормальный закон для включения различных значений асимметрии и эксцесса. Обобщенное нормальное распределение, также известное как распределение экспоненциальной степени, позволяет получить хвосты распределения с более толстым или более тонким асимптотическим поведением.
Pearson distribution — a four parameter family of probability distributions that extend the normal law to include different skewness and kurtosis values. The generalized normal distribution, also known as the exponential power distribution, allows for distribution tails with thicker or thinner asymptotic behaviors.
Средняя величина выборки
Оценочный показатель называется выборочным средним, поскольку он является средним арифметическим всех наблюдений. Статистика является полной и достаточной для , и поэтому, согласно теореме Лемана-Шеффе, является равномерно минимально несмещенной оценкой (UMVU). В конечных выборках она распределена нормально:
Дисперсия этой оценки равна элементу μμ обратной информационной матрицы Фишера. Это означает, что оценка является эффективно́й для конечных выборок. Важным практическим следствием является то, что стандартная ошибка пропорциональна , то есть, чтобы уменьшить стандартную ошибку в 10 раз, необходимо увеличить количество точек в выборке в 100 раз. Этот факт широко используется при определении объемов выборки для опросов общественного мнения и числа испытаний в методах Монте-Карло. С точки зрения асимптотической теории, является состоятельной, то есть сходится по вероятности к при . Оценка также асимптотически нормальна, что является прямым следствием ее нормальности в конечных выборках:
Скалярная форма
Следующая вспомогательная формула полезна для упрощения уравнений обновления апостериорного распределения, которые в противном случае становятся довольно громоздкими. Эта формула переписывает сумму двух квадратичных выражений относительно x, раскладывая квадраты, группируя члены с x и выделяя полный квадрат. Обратите внимание на следующее относительно комплексных постоянных коэффициентов, присоединенных к некоторым членам: Коэффициент имеет вид взвешенного среднего y и z. Это показывает, что этот коэффициент можно рассматривать как результат ситуации, когда складываются обратные величины a и b. Следовательно, чтобы объединить сами a и b, необходимо взять обратные величины, сложить их и снова взять обратную величину результата, чтобы вернуться к исходным единицам измерения. Это именно та операция, которую выполняет среднее гармоническое, поэтому неудивительно, что данный коэффициент равен половине среднего гармонического a и b.
The factor has the form of a weighted average of y and z. This shows that this factor can be thought of as resulting from a situation where the reciprocals of quantities a and b add directly, so to combine a and b themselves, it is necessary to reciprocate, add, and reciprocate the result again to get back into the original units. This is exactly the sort of operation performed by the harmonic mean, so it is not surprising that is one half the harmonic mean of a and b.
Прямо нормально.
Основное состояние квантового гармонического осциллятора имеет гауссово распределение. Определенные величины в физике распределены нормально, как впервые показал Джеймс Клерк Максвелл. Примеры таких величин:
Функция плотности вероятности основного состояния в квантовом гармоническом осцилляторе. Положение частицы, испытывающей диффузию. Если изначально частица находится в определенной точке (то есть ее распределение вероятностей является дельта-функцией Дирака), то после времени t ее положение описывается нормальным распределением с дисперсией t, удовлетворяющим уравнению диффузии. Если начальное положение задано определенной функцией плотности, то плотность в момент времени t является сверткой этой функции с нормальной функцией плотности вероятности.
Probability density function of a ground state in a quantum harmonic oscillator. The position of a particle that experiences diffusion. If initially the particle is located at a specific point (that is its probability distribution is the Dirac delta function), then after time t its location is described by a normal distribution with variance t, which satisfies the diffusion equation If the initial location is given by a certain density function , then the density at time t is the convolution of g and the normal probability density function.
Методологические проблемы и экспертный анализ
Джон Иоаннидис утверждал, что использование стандартных отклонений, имеющих нормальное распределение, в качестве критериев для подтверждения результатов исследований оставляет без проверки опровержимые предсказания относительно явлений, которые не подчиняются нормальному распределению. Это относится, например, к явлениям, которые проявляются только при одновременном наличии всех необходимых условий, когда одно условие не может заменить другое аддитивным образом, а также к явлениям, не имеющим случайного распределения. Иоаннидис утверждает, что валидация, ориентированная на стандартное отклонение, создает ложное впечатление обоснованности гипотез и теорий, в которых лишь часть, но не все, опровержимые предсказания имеют нормальное распределение, поскольку доказательства против опровержимых предсказаний могут находиться, и в некоторых случаях действительно находятся, в частях диапазона опровержимых предсказаний, не подчиняющихся нормальному распределению. Кроме того, безосновательно отклоняются гипотезы, для которых ни одно из опровержимых предсказаний не имеет нормального распределения, как будто они не подлежат фальсификации, хотя на самом деле они делают фальсифицируемые предсказания. Иоаннидис утверждает, что многие случаи принятия взаимно исключающих теорий научными журналами обусловлены неспособностью этих журналов учитывать эмпирические опровержения предсказаний, не имеющих нормального распределения, а не истинностью взаимно исключающих теорий, что невозможно, хотя две взаимно исключающие теории могут быть неверными, а третья – верной.
Именование
Сегодня эта концепция обычно известна на английском языке как нормальное распределение или гауссовское распределение. Другие, менее распространенные названия включают распределение Гаусса, распределение Лапласа-Гаусса, закон ошибок, закон закономерностей ошибок, второй закон Лапласа и гауссов закон. Сам Гаусс, по-видимому, ввел этот термин, ссылаясь на "нормальные уравнения", используемые в его приложениях, где "нормальный" имело техническое значение ортогонального, а не обычного. Однако к концу XIX века некоторые авторы начали использовать название "нормальное распределение", где слово "нормальный" употреблялось как прилагательное – термин стал рассматриваться как отражение того факта, что это распределение считалось типичным, распространенным и, следовательно, нормальным. Пирс (один из этих авторов) однажды определил "нормальный" следующим образом: " 'нормальный' – это не среднее (или любое другое среднее) того, что фактически происходит, а того, что в конечном итоге произошло бы при определенных обстоятельствах". Около рубежа XX века Пирсон популяризировал термин "нормальный" в качестве обозначения этого распределения. Также именно Пирсон впервые представил распределение через стандартное отклонение σ, как это принято в современной нотации. Вскоре после этого, в 1915 году, Фишер добавил параметр расположения к формуле нормального распределения, выразив его в той форме, в которой он используется и сегодня:
Термин "стандартное нормальное", обозначающий нормальное распределение с нулевым средним и единичной дисперсией, вошел в широкое употребление примерно в 1950-х годах, появившись в популярных учебниках П. Г. Хёля (1947) "Введение в математическую статистику" и А. М. Муда (1950) "Введение в теорию статистики".