Интервалы доверия для оценки неизвестных параметров
Confidence interval
Доверительный интервал в статистике: определение, уровень доверия, факторы, влияющие на ширину. Оценка неизвестных параметров и их вероятностное покрытие.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Диапазон для оценки неизвестного параметра
Range to estimate an unknown parameter
Неформально, в частотной статистике доверительный интервал (CI) – это интервал, который, как ожидается, будет содержать оцениваемый параметр в большинстве случаев. Более точно, при заданном уровне доверия (типичные значения – 95% и 99%), доверительный интервал представляет собой случайный интервал, который содержит оцениваемый параметр в заданный процент случаев. Уровень доверия, степень доверия или коэффициент доверия отражает долю доверительных интервалов (при данном уровне доверия), которые в долгосрочной перспективе теоретически содержат истинное значение параметра; это эквивалентно номинальной вероятности покрытия. Например, из всех интервалов, рассчитанных с уровнем доверия 95%, 95% из них должны содержать истинное значение параметра. На ширину доверительного интервала влияют размер выборки, изменчивость данных в выборке и уровень доверия. При прочих равных условиях, увеличение размера выборки приводит к сужению доверительного интервала, увеличение изменчивости выборки – к его расширению, а повышение уровня доверия – также к расширению интервала.
Informally, in frequentist statistics, a confidence interval (CI) is an interval which is expected to typically contain the parameter being estimated. More specifically, given a confidence level (95% and 99% are typical values), a CI is a random interval which contains the parameter being estimated % of the time. The confidence level, degree of confidence or confidence coefficient represents the long run proportion of CIs (at the given confidence level) that theoretically contain the true value of the parameter; this is tantamount to the nominal coverage probability. For example, out of all intervals computed at the 95% level, 95% of them should contain the parameter's true value. Factors affecting the width of the CI include the sample size, the variability in the sample, and the confidence level. All else being the same, a larger sample produces a narrower confidence interval, greater variability in the sample produces a wider confidence interval, and a higher confidence level produces a wider confidence interval.
Желаемые свойства
При применении стандартных статистических процедур часто существуют стандартные способы построения доверительных интервалов. Они разрабатываются таким образом, чтобы соответствовать определенным желательным свойствам, которые сохраняются при условии истинности предположений, на которых основана процедура. Эти желательные свойства можно описать как: достоверность, оптимальность и инвариантность. Из этих трех, "достоверность" является наиболее важной, за ней следует "оптимальность". "Инвариантность" можно рассматривать как свойство метода получения доверительного интервала, а не правила его построения. В нестандартных применениях также стремятся к этим же желательным свойствам.
When applying standard statistical procedures, there will often be standard ways of constructing confidence intervals. These will have been devised so as to meet certain desirable properties, which will hold given that the assumptions on which the procedure relies are true. These desirable properties may be described as: validity, optimality, and invariance. Of the three, "validity" is most important, followed closely by "optimality". "Invariance" may be considered as a property of the method of derivation of a confidence interval, rather than of the rule for constructing the interval. In non standard applications, these same desirable properties would be sought:
Действительность
Это означает, что заявленная вероятность покрытия (уровень достоверности) доверительного интервала должна выполняться точно или с хорошей степенью приближения.
This means that the nominal coverage probability (confidence level) of the confidence interval should hold, either exactly or to a good approximation.
Оптимальность
Это означает, что правило построения доверительного интервала должно максимально использовать информацию, содержащуюся в наборе данных. Следует помнить, что можно отбросить половину набора данных и все равно получить корректный доверительный интервал. Один из способов оценки оптимальности – это длина интервала, то есть правило построения доверительного интервала считается лучше другого, если оно приводит к интервалам, которые в среднем короче.
This means that the rule for constructing the confidence interval should make as much use of the information in the data set as possible. Recall that one could throw away half of a dataset and still be able to derive a valid confidence interval. One way of assessing optimality is by the length of the interval so that a rule for constructing a confidence interval is judged better than another if it leads to intervals whose lengths are typically shorter.
Неизменность
Во многих приложениях величина, которую оценивают, может быть не строго определена как таковая. Например, опрос может дать оценку медианного дохода в популяции, но в равной степени это можно рассматривать как оценку логарифма медианного дохода, поскольку часто именно в такой шкале представляются графические результаты. Было бы желательно, чтобы метод, используемый для построения доверительного интервала для медианного дохода, давал эквивалентные результаты при применении к построению доверительного интервала для логарифма медианного дохода: а именно, чтобы значения на концах последнего интервала были логарифмами значений на концах первого интервала.
In many applications, the quantity being estimated might not be tightly defined as such. For example, a survey might result in an estimate of the median income in a population, but it might equally be considered as providing an estimate of the logarithm of the median income, given that this is a common scale for presenting graphical results. It would be desirable that the method used for constructing a confidence interval for the median income would give equivalent results when applied to constructing a confidence interval for the logarithm of the median income: Specifically the values at the ends of the latter interval would be the logarithms of the values at the ends of former interval.
Методы вычисления
Для нестандартных приложений существует несколько подходов к получению правила построения доверительных интервалов. Установленные правила для стандартных процедур могут быть обоснованы или объяснены одним из этих подходов. Как правило, правило построения доверительного интервала тесно связано с конкретным методом получения точечной оценки оцениваемой величины.
For non standard applications, there are several routes that might be taken to derive a rule for the construction of confidence intervals. Established rules for standard procedures might be justified or explained via several of these routes. Typically a rule for constructing confidence intervals is closely tied to a particular way of finding a point estimate of the quantity being considered.
Обобщенная статистика
Это тесно связано с методом моментов для оценки параметров. Простой пример возникает, когда необходимо оценить среднее значение генеральной совокупности, в этом случае естественной оценкой является выборочное среднее. Аналогично, выборочная дисперсия может быть использована для оценки дисперсии генеральной совокупности. Доверительный интервал для истинного среднего значения можно построить, центрируя его относительно выборочного среднего, при этом ширина интервала будет кратна квадратному корню из выборочной дисперсии.
This is closely related to the method of moments for estimation. A simple example arises where the quantity to be estimated is the population mean, in which case a natural estimate is the sample mean. Similarly, the sample variance can be used to estimate the population variance. A confidence interval for the true mean can be constructed centered on the sample mean with a width which is a multiple of the square root of the sample variance.
Теория вероятности
Оценки могут быть построены на основе принципа максимального правдоподобия, а теория правдоподобия предоставляет два способа построения доверительных интервалов или доверительных областей для этих оценок.
Estimates can be constructed using the maximum likelihood principle, the likelihood theory for this provides two ways of constructing confidence intervals or confidence regions for the estimates.
Уравнения оценки
Подход к оценке, используемый здесь, можно рассматривать как обобщение метода моментов и, одновременно, обобщение метода максимального правдоподобия. Существуют соответствующие обобщения результатов теории максимального правдоподобия, позволяющие строить доверительные интервалы на основе оценок, полученных из оценочных уравнений.
The estimation approach here can be considered as both a generalization of the method of moments and a generalization of the maximum likelihood approach. There are corresponding generalizations of the results of maximum likelihood theory that allow confidence intervals to be constructed based on estimates derived from estimating equations.
Интерпретация
Можно дать различные интерпретации доверительного интервала (в качестве примера приведем 95% доверительный интервал). Доверительный интервал можно интерпретировать как частоту, с которой он будет содержать истинное значение параметра генеральной совокупности в серии повторных выборок: "Если бы данная процедура была повторена многократно на различных выборках, то примерно 95% из вычисленных 95% доверительных интервалов содержали бы истинное значение параметра генеральной совокупности."
Various interpretations of a confidence interval can be given (taking the 95% confidence interval as an example in the following). The confidence interval can be expressed in terms of a long run frequency in repeated samples (or in resampling): "Were this procedure to be repeated on numerous samples, the proportion of calculated 95% confidence intervals that encompassed the true value of the population parameter would tend toward 95%."
Доверенность в процедуре для ω2
Штайгер предложил ряд процедур доверия для распространенных мер размера эффекта в ANOVA. Мори и др. Основные идеи доверительных интервалов в целом были разработаны в начале 1930-х годов, а первое подробное и общее изложение было представлено Ежи Нейманом в 1937 году. Примерно в то же время Фишер опубликовал свою первую работу, посвященную фидуциальным распределениям и фидуциальному аргументу. Довольно неожиданно, хотя концептуальная основа фидуциального аргумента полностью отличается от концепции доверительных интервалов, конкретные решения ряда частных задач совпали. Таким образом, в первой статье, в которой я представил теорию доверительных интервалов, опубликованной в 1934 году, к 1988 году медицинские журналы стали требовать указания доверительных интервалов.
Steiger suggested a number of confidence procedures for common effect size measures in ANOVA. Morey et al. The main ideas of confidence intervals in general were developed in the early 1930s, and the first thorough and general account was given by Jerzy Neyman in 1937. It so happened that, somewhat earlier, Fisher published his first paper concerned with fiducial distributions and fiducial argument. Quite unexpectedly, while the conceptual framework of fiducial argument is entirely different from that of confidence intervals, the specific solutions of several particular problems coincided. Thus, in the first paper in which I presented the theory of confidence intervals, published in 1934, By 1988, medical journals were requiring the reporting of confidence intervals.