Маржинальное распределение в теории вероятностей и статистике: определение, отличие от условного распределения, расчет и применение. Объяснение простыми словами.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Аспект вероятности и статистики
Aspect of probability and statistics
В теории вероятностей и статистике предельное распределение подмножества набора случайных величин – это распределение вероятностей величин, входящих в это подмножество. Оно определяет вероятности различных значений переменных в подмножестве, не принимая во внимание значения остальных переменных. Это отличается от условного распределения, которое определяет вероятности при заданных значениях других переменных. Переменные, входящие в рассматриваемое подмножество, называются маргинальными. Эти понятия называются "маргинальными", поскольку их можно получить, суммируя значения в таблице по строкам или столбцам и записывая сумму на полях этой таблицы. Распределение маргинальных переменных (предельное распределение) получается путем интегрирования (то есть фокусировки на суммах на полях) по распределению отбрасываемых переменных, при этом отбрасываемые переменные считаются исключенными. Контекст здесь заключается в том, что теоретические исследования или анализ данных включают в себя более широкий набор случайных величин, но внимание ограничивается меньшим их числом. Во многих приложениях анализ может начинаться с заданного набора случайных величин, затем расширяться путем определения новых (например, суммы исходных случайных величин), и, наконец, сужаться до рассмотрения предельного распределения подмножества (например, той же суммы). Может быть выполнено несколько различных анализов, каждый из которых рассматривает различное подмножество переменных как маргинальное распределение.
In probability theory and statistics, the marginal distribution of a subset of a collection of random variables is the probability distribution of the variables contained in the subset. It gives the probabilities of various values of the variables in the subset without reference to the values of the other variables. This contrasts with a conditional distribution, which gives the probabilities contingent upon the values of the other variables. Marginal variables are those variables in the subset of variables being retained. These concepts are "marginal" because they can be found by summing values in a table along rows or columns, and writing the sum in the margins of the table. The distribution of the marginal variables (the marginal distribution) is obtained by marginalizing (that is, focusing on the sums in the margin) over the distribution of the variables being discarded, and the discarded variables are said to have been marginalized out. The context here is that the theoretical studies being undertaken, or the data analysis being done, involves a wider set of random variables but that attention is being limited to a reduced number of those variables. In many applications, an analysis may start with a given collection of random variables, then first extend the set by defining new ones (such as the sum of the original random variables) and finally reduce the number by placing interest in the marginal distribution of a subset (such as the sum). Several different analyses may be done, each treating a different subset of variables as the marginal distribution.
Функция плотности предельной вероятности
При наличии двух непрерывных случайных переменных X и Y, совместное распределение которых известно, маргинальная плотность вероятности может быть получена интегрированием совместного распределения вероятности f по Y, и наоборот. То есть
Given two continuous random variables X and Y whose joint distribution is known, then the marginal probability density function can be obtained by integrating the joint probability distribution, f, over Y, and vice versa. That is
где , и .
where , and .
Пример из реального мира
Предположим, что необходимо вычислить вероятность того, что пешеход будет сбит автомобилем, пересекая дорогу по пешеходному переходу, не обращая внимания на светофор. Пусть H – дискретная случайная величина, принимающая одно значение из множества {Сбит, Не сбит}. Пусть L (обозначает светофор) – дискретная случайная величина, принимающая одно значение из множества {Красный, Желтый, Зеленый}. Очевидно, H будет зависеть от L. То есть, P(H = Сбит) будет принимать разные значения в зависимости от того, горит ли красный, желтый или зеленый свет (и аналогично для P(H = Не сбит)). Например, вероятность быть сбитым автомобилем гораздо выше, если человек пытается перейти дорогу на зеленый свет для перпендикулярного движения, чем на красный. Другими словами, для любой возможной пары значений H и L необходимо рассмотреть совместное распределение вероятностей H и L, чтобы найти вероятность одновременного наступления этих событий, если пешеход игнорирует состояние светофора. Однако, при вычислении предельной вероятности P(H = Сбит), мы ищем вероятность того, что H = Сбит в ситуации, когда конкретное значение L неизвестно и пешеход игнорирует состояние светофора. В общем случае, пешехода могут сбить, если горит красный, желтый или зеленый свет. Следовательно, предельную вероятность можно найти, суммируя P(H|L) для всех возможных значений L, причем каждое значение L взвешивается его вероятностью появления. Ниже представлена таблица, показывающая условные вероятности быть сбитым в зависимости от состояния светофора. (Обратите внимание, что сумма столбцов в этой таблице должна быть равна 1, поскольку вероятность быть сбитым или не быть сбитым равна 1 независимо от состояния светофора.) + Условное распределение: Красный Желтый Зеленый Не сбит 0.99 0.9 0.2 Сбит 0.01 0.1 0.8
Suppose that the probability that a pedestrian will be hit by a car, while crossing the road at a pedestrian crossing, without paying attention to the traffic light, is to be computed. Let H be a discrete random variable taking one value from {Hit, Not Hit}. Let L (for traffic light) be a discrete random variable taking one value from {Red, Yellow, Green}. Realistically, H will be dependent on L. That is, P(H = Hit) will take different values depending on whether L is red, yellow or green (and likewise for P(H = Not Hit)). A person is, for example, far more likely to be hit by a car when trying to cross while the lights for perpendicular traffic are green than if they are red. In other words, for any given possible pair of values for H and L, one must consider the joint probability distribution of H and L to find the probability of that pair of events occurring together if the pedestrian ignores the state of the light. However, in trying to calculate the marginal probability P(H = Hit), what is being sought is the probability that H = Hit in the situation in which the particular value of L is unknown and in which the pedestrian ignores the state of the light. In general, a pedestrian can be hit if the lights are red OR if the lights are yellow OR if the lights are green. So, the answer for the marginal probability can be found by summing P(H | L) for all possible values of L, with each value of L weighted by its probability of occurring. Here is a table showing the conditional probabilities of being hit, depending on the state of the lights. (Note that the columns in this table must add up to 1 because the probability of being hit or not hit is 1 regardless of the state of the light.) + Conditional distribution: RedYellowGreen Not Hit 0.99 0.9 0.2 Hit 0.01 0.1 0.8
Для определения совместного распределения вероятностей требуются дополнительные данные. Например, предположим, что P(L = красный) = 0.2, P(L = желтый) = 0.1 и P(L = зеленый) = 0.7. Умножение каждого столбца в условном распределении на вероятность появления этого столбца дает совместное распределение вероятностей H и L, представленное в центральном блоке 2x3. (Обратите внимание, что сумма ячеек в этом блоке 2x3 равна 1). + Совместное распределение: P(H,L) Красный Желтый Зеленый Предельная вероятность P(H) Не сбит 0.198 0.09 0.14 0.428 Сбит 0.002 0.01 0.56 0.572 Итого 0.2 0.1 0.7 1
To find the joint probability distribution, more data is required. For example, suppose P(L = red) = 0.2, P(L = yellow) = 0.1, and P(L = green) = 0.7. Multiplying each column in the conditional distribution by the probability of that column occurring results in the joint probability distribution of H and L, given in the central 2×3 block of entries. (Note that the cells in this 2×3 block add up to 1). + Joint distribution: P(H,L) RedYellowGreenMarginal probability P(H) Not Hit 0.198 0.09 0.14 0.428 Hit 0.002 0.01 0.56 0.572 Total 0.2 0.1 0.7 1
Предельная вероятность P(H = Сбит) равна сумме 0.572 вдоль строки H = Сбит в этой таблице совместного распределения, поскольку это вероятность быть сбитым, когда горит красный, желтый или зеленый свет. Аналогично, предельная вероятность P(H = Не сбит) равна сумме вдоль строки H = Не сбит.
The marginal probability P(H = Hit) is the sum 0.572 along the H = Hit row of this joint distribution table, as this is the probability of being hit when the lights are red OR yellow OR green. Similarly, the marginal probability that P(H = Not Hit) is the sum along the H = Not Hit row.