Введение

Тип статистической вероятности

Толерантный интервал (ТИ) – это статистический интервал, внутри которого, с заданной вероятностью, находится указанная доля элементов генеральной совокупности, отобранных в выборке. "Более точно, толерантный интервал с вероятностью p/100 и уровнем доверия (1-α)/100 определяет пределы, в пределах которых с вероятностью (1-α) находится не менее чем доля p элементов генеральной совокупности." "Толерантный интервал (ТИ) (p, 1−α), построенный на основе выборки, создается таким образом, чтобы он содержал не менее доли p элементов генеральной совокупности с уровнем доверия 1−α; такой ТИ обычно называют ТИ с содержанием p и покрытием (1−α)." "Верхняя граница толерантности (TL) (p, 1−α) – это, по сути, верхняя граница доверия с уровнем (1−α) для p-го процентиля генеральной совокупности."

Отношение к другим интервалам

В случае известных параметров, 95%-ный интервал толерантности и 95%-ный интервал прогноза совпадают. Если бы мы знали точные параметры популяции, мы могли бы вычислить диапазон, в пределах которого находится определенная доля популяции. Например, если мы знаем, что популяция имеет нормальное распределение со средним значением μ и стандартным отклонением σ, то интервал μ ± 1.96σ включает 95% популяции (1.96 – это z-значение, соответствующее 95% охвату для нормально распределенной популяции). Однако, если у нас есть только выборка из популяции, мы знаем только выборочное среднее x̄ и выборочное стандартное отклонение s, которые являются лишь оценками истинных параметров. В этом случае μ ± 1.96s не обязательно будет включать 95% популяции из-за изменчивости этих оценок. Интервал толерантности учитывает эту изменчивость, вводя уровень достоверности γ, который определяет уверенность в том, что интервал действительно включает указанную долю популяции. Для нормально распределенной популяции z-значение можно преобразовать в "k-фактор" или фактор толерантности для заданного γ с помощью таблиц или приближенных формул. "По мере увеличения числа степеней свободы интервалы прогноза и толерантности становятся равными". Интервал толерантности менее известен, чем доверительный интервал и интервал прогноза, что, по мнению некоторых преподавателей, приводит к неправильному использованию других интервалов, когда интервал толерантности был бы более уместен. Интервал толерантности отличается от доверительного интервала тем, что доверительный интервал определяет границы для единственного параметра популяции (например, среднего или дисперсии) с определенной достоверностью, в то время как интервал толерантности определяет границы диапазона значений данных, включающего определенную долю популяции. В то время как размер доверительного интервала обусловлен исключительно ошибкой выборки и стремится к интервалу нулевой ширины при увеличении размера выборки, размер интервала толерантности обусловлен как ошибкой выборки, так и фактической изменчивостью в популяции и стремится к интервалу вероятности популяции при увеличении размера выборки.

Примеры

Приведем следующий пример: Итак, рассмотрим еще раз классический сценарий испытания расхода топлива EPA, в котором несколько номинально идентичных автомобилей определенной модели тестируются для получения данных о расходе. Если эти данные обрабатываются для построения 95% доверительного интервала для среднего расхода топлива модели, то, например, его можно использовать для прогнозирования среднего или общего потребления бензина для всего выпущенного парка таких автомобилей в первые 5000 миль эксплуатации. Однако такой интервал не будет особенно полезен человеку, арендующему одну из этих машин и сомневающемуся, хватит ли (полного) 10-галлонного бака бензина, чтобы проехать 350 миль до места назначения. Для этой задачи гораздо полезнее был бы интервал прогнозирования. (Рассмотрите различные последствия уверенности "на 95%" в том, что , по сравнению с уверенностью "на 95%" в том, что .) Но ни доверительный интервал для среднего расхода топлива, ни интервал прогнозирования для одного дополнительного измерения расхода не дают того, что нужно инженеру-конструктору, которому поручено определить, какого размера бак необходим модели, чтобы гарантировать, что 99% произведенных автомобилей смогут проехать 400 миль без дозаправки. Инженеру нужен интервал допуска для доли автомобилей с определенным расходом топлива. Другой пример: уровни содержания свинца в воздухе были измерены в разных точках на территории предприятия. Было установлено, что логарифмически преобразованные уровни свинца хорошо соответствуют нормальному распределению (то есть данные имеют логнормальное распределение). Пусть и обозначают соответственно среднее значение и дисперсию логарифмически преобразованных данных. Если обозначает соответствующую случайную величину, то мы имеем. Отметим, что является медианой уровня свинца в воздухе. Доверительный интервал для можно построить обычным способом, на основе t-распределения; это, в свою очередь, даст доверительный интервал для медианы уровня свинца в воздухе. Если и обозначают выборочное среднее и выборочное стандартное отклонение логарифмически преобразованных данных для выборки размера n, то 95% доверительный интервал для дается формулой , где обозначает -квантиль t-распределения с степенями свободы. Также может быть интересно получить 95% верхнюю доверительную границу для медианы уровня свинца в воздухе. Такая граница для дается следующим образом: Следовательно, 95% верхняя доверительная граница для медианного уровня свинца в воздухе дается формулой. Теперь предположим, что мы хотим спрогнозировать уровень свинца в воздухе в определенной точке лаборатории. 95% верхняя граница прогноза для логарифмически преобразованного уровня свинца дается формулой. Аналогичным образом можно вычислить двухсторонний интервал прогноза. Значение и интерпретация этих интервалов хорошо известны. Например, если доверительный интервал вычисляется многократно из независимых выборок, то 95% этих интервалов будут содержать истинное значение в долгосрочной перспективе. Другими словами, интервал предназначен для предоставления информации только о параметре . Интервал прогнозирования имеет аналогичную интерпретацию и предназначен для предоставления информации об одном конкретном уровне свинца. Теперь предположим, что мы хотим использовать выборку, чтобы сделать вывод о том, что по крайней мере 95% уровней свинца в популяции ниже определенного порогового значения. Доверительный интервал и интервал прогнозирования не могут ответить на этот вопрос, поскольку доверительный интервал относится только к медиане уровня свинца, а интервал прогнозирования – только к одному уровню свинца. В этом случае требуется интервал допуска; точнее, верхняя граница допуска. Верхняя граница допуска должна быть вычислена при условии, что по крайней мере 95% уровней свинца в популяции ниже этой границы, с определенным уровнем доверия, например, 99%.