Введение
Смещенный оценщик для гауссовских случайных векторов, превосходящий обычную минимизацию среднеквадратичной ошибки.
Оценщик Джеймса — Штейна является смещенным оценщиком среднего значения, μ, (возможно) коррелированных случайных величин, имеющих гауссовское распределение, с неизвестными средними значениями. Он был разработан последовательно в двух основных опубликованных работах. Более ранняя версия оценщика появилась в 1956 году, когда Чарльз Стайн пришел к довольно неожиданному выводу о том, что, хотя общепринятая оценка среднего значения – среднее выборочное – является допустимой при n > 2, она становится недопустимой при n = 1. Стайн предложил возможное улучшение оценщика, которое "стягивает" средние выборочные к более центральному среднему вектору (который можно выбрать априори или, как правило, в качестве "среднего от средних" средних выборочных, при условии, что все выборки имеют одинаковый размер). Это наблюдение обычно называют примером или парадоксом Стейна. В 1961 году Уиллард Джеймс и Чарльз Стайн упростили исходный метод. Можно показать, что оценщик Джеймса — Штейна доминирует над "обычным" методом наименьших квадратов, то есть имеет меньшую или равную среднеквадратичную ошибку, чем "обычный" оценщик наименьших квадратов. Подобно оценщику Ходжеса, оценщик Джеймса — Штейна является сверхэффективным и нерегулярным при n = 1.
The James–Stein estimator is a biased estimator of the mean, , of (possibly) correlated Gaussian distributed random variables with unknown means
It arose sequentially in two main published papers. The earlier version of the estimator was developed in 1956, when Charles Stein reached a relatively shocking conclusion that while the then usual estimate of the mean, the sample mean, is admissible when , it is inadmissible when Stein proposed a possible improvement to the estimator that shrinks the sample means towards a more central mean vector (which can be chosen a priori or commonly as the "average of averages" of the sample means, given all samples share the same size). This observation is commonly referred to as Stein's example or paradox. In 1961, Willard James and Charles Stein simplified the original process. It can be shown that the James–Stein estimator dominates the "ordinary" least squares approach, meaning the James–Stein estimator has a lower or equal mean squared error than the "ordinary" least square estimator. Similar to the Hodges' estimator, the James Stein estimator is superefficient and non regular at .
Обстановка
Пусть где вектор является неизвестным средним , который нормально распределен с известной ковариационной матрицей . Мы заинтересованы в получении оценки, , для , основанной на единичном наблюдении, , от . В реальных приложениях это распространенная ситуация, когда набор параметров отбирается, а выборки искажаются независимым гауссовским шумом. Поскольку этот шум имеет нулевое среднее, разумно использовать сами выборки в качестве оценки параметров. Этот подход является оценщиком методом наименьших квадратов, который является .
We are interested in obtaining an estimate, , of , based on a single observation, , of
In real world application, this is a common situation in which a set of parameters is sampled, and the samples are corrupted by independent Gaussian noise. Since this noise has mean of zero, it may be reasonable to use the samples themselves as an estimate of the parameters. This approach is the least squares estimator, which is
Stein demonstrated that in terms of mean squared error , the least squares estimator, , is sub optimal to a shrinkage based estimators, such as the James–Stein estimator, By definition, this makes the least squares estimator inadmissible when
Notice that if then this estimator simply takes the natural estimator and shrinks it towards the origin 0. In fact this is not the only direction of shrinkage that works. Let ν be an arbitrary fixed vector of dimension Then there exists an estimator of the James–Stein type that shrinks toward ν, namely
The James–Stein estimator dominates the usual estimator for any ν. A natural question to ask is whether the improvement over the usual estimator is independent of the choice of ν. The answer is no. The improvement is small if is large. Thus to get a very great improvement some knowledge of the location of θ is necessary. Of course this is the quantity we are trying to estimate so we don't have this knowledge a priori. But we may have some guess as to what the mean vector is. This can be considered a disadvantage of the estimator: the choice is not objective as it may depend on the beliefs of the researcher. Nonetheless, James and Stein's result is that any finite guess ν improves the expected MSE over the maximum likelihood estimator, which is tantamount to using an infinite ν, surely a poor guess.
Штейн показал, что с точки зрения среднеквадратичной ошибки, оценщик методом наименьших квадратов, , является субоптимальным по сравнению с оценщиками на основе усадки, такими как оценщик Джеймса — Стейна. По определению, это делает оценщик методом наименьших квадратов неприемлемым, когда . Заметим, что если , то этот оценщик просто принимает естественный оценщик и сжимает его к началу координат 0. На самом деле, это не единственное направление усадки, которое работает. Пусть ν — произвольный фиксированный вектор размерности . Тогда существует оценщик типа Джеймса — Стейна, который сжимается к ν, а именно:
We are interested in obtaining an estimate, , of , based on a single observation, , of
In real world application, this is a common situation in which a set of parameters is sampled, and the samples are corrupted by independent Gaussian noise. Since this noise has mean of zero, it may be reasonable to use the samples themselves as an estimate of the parameters. This approach is the least squares estimator, which is
Stein demonstrated that in terms of mean squared error , the least squares estimator, , is sub optimal to a shrinkage based estimators, such as the James–Stein estimator, By definition, this makes the least squares estimator inadmissible when
Notice that if then this estimator simply takes the natural estimator and shrinks it towards the origin 0. In fact this is not the only direction of shrinkage that works. Let ν be an arbitrary fixed vector of dimension Then there exists an estimator of the James–Stein type that shrinks toward ν, namely
The James–Stein estimator dominates the usual estimator for any ν. A natural question to ask is whether the improvement over the usual estimator is independent of the choice of ν. The answer is no. The improvement is small if is large. Thus to get a very great improvement some knowledge of the location of θ is necessary. Of course this is the quantity we are trying to estimate so we don't have this knowledge a priori. But we may have some guess as to what the mean vector is. This can be considered a disadvantage of the estimator: the choice is not objective as it may depend on the beliefs of the researcher. Nonetheless, James and Stein's result is that any finite guess ν improves the expected MSE over the maximum likelihood estimator, which is tantamount to using an infinite ν, surely a poor guess.
Оценщик Джеймса — Стейна доминирует над обычным оценщиком для любого ν. Естественный вопрос, который возникает, заключается в том, является ли улучшение по сравнению с обычным оценщиком независимым от выбора ν. Ответ — нет. Улучшение невелико, если велико. Таким образом, для получения значительного улучшения необходимо некоторое знание местоположения θ. Конечно, это величина, которую мы пытаемся оценить, поэтому у нас нет этого знания априори. Но у нас может быть некоторое предположение относительно среднего вектора. Это можно считать недостатком оценщика: выбор не является объективным, поскольку он может зависеть от убеждений исследователя. Тем не менее, результат Джеймса и Стейна заключается в том, что любое конечное предположение ν улучшает ожидаемый MSE по сравнению с оценщиком максимального правдоподобия, что эквивалентно использованию бесконечной ν, безусловно, плохого предположения.
We are interested in obtaining an estimate, , of , based on a single observation, , of
In real world application, this is a common situation in which a set of parameters is sampled, and the samples are corrupted by independent Gaussian noise. Since this noise has mean of zero, it may be reasonable to use the samples themselves as an estimate of the parameters. This approach is the least squares estimator, which is
Stein demonstrated that in terms of mean squared error , the least squares estimator, , is sub optimal to a shrinkage based estimators, such as the James–Stein estimator, By definition, this makes the least squares estimator inadmissible when
Notice that if then this estimator simply takes the natural estimator and shrinks it towards the origin 0. In fact this is not the only direction of shrinkage that works. Let ν be an arbitrary fixed vector of dimension Then there exists an estimator of the James–Stein type that shrinks toward ν, namely
The James–Stein estimator dominates the usual estimator for any ν. A natural question to ask is whether the improvement over the usual estimator is independent of the choice of ν. The answer is no. The improvement is small if is large. Thus to get a very great improvement some knowledge of the location of θ is necessary. Of course this is the quantity we are trying to estimate so we don't have this knowledge a priori. But we may have some guess as to what the mean vector is. This can be considered a disadvantage of the estimator: the choice is not objective as it may depend on the beliefs of the researcher. Nonetheless, James and Stein's result is that any finite guess ν improves the expected MSE over the maximum likelihood estimator, which is tantamount to using an infinite ν, surely a poor guess.
Интерпретация
Рассматривая оценщик Джеймса–Стейна как метод эмпирического Байеса, можно получить некоторое понимание этого результата: предполагается, что θ само по себе является случайной величиной с априорным распределением, где A оценивается на основе самих данных. Оценка A дает преимущество по сравнению с оценкой максимального правдоподобия только тогда, когда размерность достаточно велика; следовательно, она не работает для. Оценщик Джеймса–Стейна является представителем класса байесовских оценщиков, которые превосходят оценку максимального правдоподобия. Следствием вышесказанного является следующий контринтуитивный результат: при измерении трех или более несвязанных параметров их общая среднеквадратичная ошибка (МСЭ) может быть уменьшена с помощью комбинированного оценщика, такого как оценщик Джеймса–Стейна; в то время как при отдельной оценке каждого параметра допустим оценщик наименьших квадратов (OLS). Причудливым примером может служить одновременная оценка скорости света, потребления чая на Тайване и веса свиней в Монтане. Оценщик Джеймса–Стейна всегда улучшает общую МСЭ, то есть сумму ожидаемых квадратов ошибок каждого компонента. Следовательно, общая МСЭ при измерении скорости света, потребления чая и веса свиней будет уменьшена при использовании оценщика Джеймса–Стейна. Однако для отдельных компонентов (например, скорости света) оценка может улучшиться для одних значений параметров и ухудшиться для других. Таким образом, хотя оценщик Джеймса–Стейна превосходит оценщик OLS при оценке трех или более параметров, ни один отдельный компонент не превосходит соответствующий компонент оценщика OLS. Вывод из этого гипотетического примера заключается в том, что измерения следует объединять, если целью является минимизация их общей МСЭ. Например, в телекоммуникациях разумно объединять измерения характеристик канала при оценке канала, поскольку целью является минимизация общей ошибки оценки канала. Оценщик Джеймса–Стейна также нашел применение в фундаментальной квантовой теории, где он использовался для улучшения теоретических границ принципа неопределенности Энтрóпии для более чем трех измерений. Интуитивное выведение и интерпретация даются с гальтонианской точки зрения. В рамках этой интерпретации мы стремимся предсказать средние значения генеральной совокупности, используя неточно измеренные средние значения выборки. Уравнение оценщика OLS в гипотетической регрессии средних значений генеральной совокупности на средние значения выборки дает оценщик, который имеет вид оценщика Джеймса–Стейна (если мы принудительно устанавливаем пересечение OLS равным 0) или оценщика Эфрона–Морриса (если мы позволяем пересечению изменяться).
Улучшения
Несмотря на интуитивное представление о том, что оценщик Джеймса-Стейна сжимает оценку максимального правдоподобия к , на самом деле оценка отклоняется от для малых значений , поскольку множитель при этом отрицателен. Это легко исправить, заменив этот множитель нулем, когда он отрицательный. Полученный оценщик называется оценщиком Джеймса-Стейна с положительной частью и задается формулой:
Этот оценщик имеет меньший риск, чем базовый оценщик Джеймса-Стейна. Следовательно, сам базовый оценщик Джеймса-Стейна является недопустимым. Однако оказывается, что оценщик с положительной частью также недопустим. Результат Штейна был расширен на широкий класс распределений и функций потерь. Тем не менее, эта теория предоставляет лишь результат существования, поскольку явно превосходящие оценщики фактически не были представлены. Достаточно сложно получить явные оценщики, улучшающие обычный оценщик, без конкретных ограничений на лежащие в основе распределения.