Распространение неопределенностей переменных и их влияние на неопределенность функции.
Propagation of uncertainty
Распространение неопределенностей: как ошибки измерений влияют на точность вычислений. Абсолютная и относительная погрешность, методы оценки в статистике.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Влияние неопределенностей переменных на неопределенность функции, основанной на них, и распространение неопределенности во времени.
Effect of variables' uncertainties on the uncertainty of a function based on them
the propagation of uncertainty through time
В статистике распространение неопределенности (или распространение ошибки) — это влияние неопределенностей переменных (или, точнее, случайных ошибок) на неопределенность функции, основанной на них. Когда переменные представляют собой значения экспериментальных измерений, они имеют неопределенности, обусловленные ограничениями измерений (например, точностью приборов), которые распространяются в результате комбинирования переменных в функции. Неопределенность *u* может быть выражена различными способами. Она может быть определена абсолютной погрешностью Δ*x*. Неопределенности также могут быть определены относительной погрешностью (Δ*x*)/ *x*, которая обычно выражается в процентах. Чаще всего неопределенность величины количественно оценивается через стандартное отклонение σ, которое является положительным квадратным корнем дисперсии. Значение величины и ее погрешность затем представляются в виде интервала *x* ± *u*. Однако наиболее общим способом характеристики неопределенности является указание ее распределения вероятностей. Если распределение вероятностей переменной известно или может быть предположено, теоретически можно получить любую ее статистику. В частности, можно вывести пределы доверия для описания области, в пределах которой может находиться истинное значение переменной. Например, 68%-ные пределы доверия для одномерной переменной, подчиняющейся нормальному распределению, приблизительно равны ± одному стандартному отклонению σ от центрального значения *x*, что означает, что область *x* ± σ охватит истинное значение примерно в 68% случаев. Если неопределенности коррелированы, необходимо учитывать ковариацию. Корреляция может возникать из двух различных источников. Во-первых, ошибки измерений могут быть коррелированы. Во-вторых, когда базовые значения коррелированы в популяции, неопределенности в групповых средних будут коррелированы. В общем случае, когда нелинейная функция изменяет неопределенные параметры (коррелированные или нет), стандартными инструментами для распространения неопределенности и определения результирующего распределения вероятностей/статистики количества являются методы выборки из семейства методов Монте-Карло. Для очень больших объемов данных или сложных функций вычисление распространения ошибки может быть весьма затратным, поэтому может потребоваться суррогатная модель или стратегия параллельных вычислений. В некоторых конкретных случаях вычисление распространения неопределенности можно выполнить с помощью упрощенных алгебраических процедур. Некоторые из этих сценариев описаны ниже.
In statistics, propagation of uncertainty (or propagation of error) is the effect of variables' uncertainties (or errors, more specifically random errors) on the uncertainty of a function based on them. When the variables are the values of experimental measurements they have uncertainties due to measurement limitations (e. g., instrument precision) which propagate due to the combination of variables in the function. The uncertainty u can be expressed in a number of ways. It may be defined by the absolute error Δx. Uncertainties can also be defined by the relative error (Δx)/x, which is usually written as a percentage. Most commonly, the uncertainty on a quantity is quantified in terms of the standard deviation, σ, which is the positive square root of the variance. The value of a quantity and its error are then expressed as an interval x ± u. However, the most general way of characterizing uncertainty is by specifying its probability distribution. If the probability distribution of the variable is known or can be assumed, in theory it is possible to get any of its statistics. In particular, it is possible to derive confidence limits to describe the region within which the true value of the variable may be found. For example, the 68% confidence limits for a one dimensional variable belonging to a normal distribution are approximately ± one standard deviation σ from the central value x, which means that the region x ± σ will cover the true value in roughly 68% of cases. If the uncertainties are correlated then covariance must be taken into account. Correlation can arise from two different sources. First, the measurement errors may be correlated. Second, when the underlying values are correlated across a population, the uncertainties in the group averages will be correlated. In a general context where a nonlinear function modifies the uncertain parameters (correlated or not), the standard tools to propagate uncertainty, and infer resulting quantity probability distribution/statistics, are sampling techniques from the Monte Carlo method family. For very expansive data or complex functions, the calculation of the error propagation may be very expansive so that a surrogate model or a parallel computing strategy may be necessary. In some particular cases, the uncertainty propagation calculation can be done through simplistic algebraic procedures. Some of these scenarios are described below.
Нелинейные комбинации
Когда f является нелинейной комбинацией переменных x, можно выполнить интервальный анализ для вычисления интервалов, содержащих все допустимые значения переменных. В вероятностном подходе функция f обычно линеаризуется путем приближения разложением в ряд Тейлора первого порядка, хотя в некоторых случаях можно получить точные формулы, не зависящие от разложения, как, например, для точной дисперсии произведений. Разложение Тейлора будет:
When f is a set of non linear combination of the variables x, an interval propagation could be performed in order to compute intervals which contain all consistent values for the variables. In a probabilistic approach, the function f must usually be linearised by approximation to a first order Taylor series expansion, though in some cases, exact formulae can be derived that do not depend on the expansion as is the case for the exact variance of products. The Taylor expansion would be:
где обозначает частную производную fk по i-й переменной, вычисленную в точке среднего значения всех компонентов вектора x. Или в матричной форме:
where denotes the partial derivative of fk with respect to the i th variable, evaluated at the mean value of all components of vector x. Or in matrix notation,
где J – матрица Якоби. Поскольку f0 является константой, она не вносит вклад в ошибку в f. Следовательно, распространение ошибки подчиняется линейному случаю, описанному выше, но с заменой линейных коэффициентов Aki и Akj на частные производные, и в матричной форме:
where J is the Jacobian matrix. Since f0 is a constant it does not contribute to the error on f. Therefore, the propagation of error follows the linear case, above, but replacing the linear coefficients, Aki and Akj by the partial derivatives, and In matrix notation,
То есть, матрица Якоби используется для преобразования строк и столбцов матрицы ковариации аргумента. Следует отметить, что это эквивалентно матричному выражению для линейного случая с .
That is, the Jacobian of the function is used to transform the rows and columns of the variance covariance matrix of the argument. Note this is equivalent to the matrix expression for the linear case with .
Предупреждения и предупреждения
Оценки ошибок для нелинейных функций смещены из-за использования усеченного разложения в ряд. Степень этого смещения зависит от природы функции. Например, смещение в оценке ошибки для log(1+x) возрастает с увеличением x, поскольку разложение является хорошим приближением только при x, близком к нулю. Для сильно нелинейных функций существует пять категорий вероятностных подходов к распространению неопределенностей; подробности см. в разделе «Количественная оценка неопределенностей».
Error estimates for non linear functions are biased on account of using a truncated series expansion. The extent of this bias depends on the nature of the function. For example, the bias on the error calculated for log(1+x) increases as x increases, since the expansion to x is a good approximation only when x is near zero. For highly non linear functions, there exist five categories of probabilistic approaches for uncertainty propagation; see Uncertainty quantification for details.
Реципрочный и смещенный реципрочный
В частном случае обратной величины или реципрокной, где следует стандартному нормальному распределению, результирующее распределение является реципрокным стандартным нормальным распределением, и определяемая дисперсия отсутствует. Однако, в несколько более общем случае сдвинутой реципрокной функции для , следующей общему нормальному распределению, статистики среднего и дисперсии существуют в смысле главного значения, если разность между полюсом и средним является вещественным числом.
In the special case of the inverse or reciprocal , where follows a standard normal distribution, the resulting distribution is a reciprocal standard normal distribution, and there is no definable variance. However, in the slightly more general case of a shifted reciprocal function for following a general normal distribution, then mean and variance statistics do exist in a principal value sense, if the difference between the pole and the mean is real valued.
Соотношения
Отношения также представляют собой проблему; нормальные аппроксимации возможны при определенных условиях.
Ratios are also problematic; normal approximations exist under certain conditions.
Влияние корреляции на различия
Если A и B некоррелированы, то их разность A − B будет иметь большую дисперсию, чем любая из них. Увеличение положительной корреляции уменьшит дисперсию разности, стремясь к нулевой дисперсии для идеально коррелированных переменных с одинаковой дисперсией. С другой стороны, отрицательная корреляция еще больше увеличит дисперсию разности по сравнению с некоррелированным случаем. Например, вычитание величины из самой себя, f = A − A, имеет нулевую дисперсию только в том случае, если величина идеально автокоррелирована. Если A некоррелирован, то выходная дисперсия в два раза больше входной дисперсии, а если A идеально антикоррелирован, то выходная дисперсия в четыре раза больше входной дисперсии (обратите внимание на f = aA − aA в таблице выше).
If A and B are uncorrelated, their difference A − B will have more variance than either of them. An increasing positive correlation will decrease the variance of the difference, converging to zero variance for perfectly correlated variables with the same variance. On the other hand, a negative correlation will further increase the variance of the difference, compared to the uncorrelated case. For example, the self subtraction f = A − A has zero variance only if the variate is perfectly autocorrelated If A is uncorrelated, then the output variance is twice the input variance, And if A is perfectly anticorrelated, then the input variance is quadrupled in the output, (notice for f = aA − aA in the table above).