Введение
Феномен в теории принятия решений и теории оценивания
В теории принятия решений и теории оценивания пример Стейна (также известный как феномен Стейна или парадокс Стейна) заключается в том, что при одновременной оценке трех и более параметров существуют комбинированные оценщики, которые в среднем более точны (то есть имеют меньшую математическое ожидание среднеквадратичной ошибки), чем любой метод, оценивающий параметры по отдельности. Он назван в честь Чарльза Стейна из Стэнфордского университета, который обнаружил этот феномен в 1955 году. Интуитивное объяснение состоит в том, что оптимизация математического ожидания среднеквадратичной ошибки для комбинированного оценщика не эквивалентна оптимизации ошибок отдельных оценщиков для каждого параметра в отдельности. На практике, если комбинированная ошибка представляет собой интересующую величину, следует использовать комбинированный оценщик, даже если базовые параметры независимы. Если же интересует оценка отдельного параметра, то использование комбинированного оценщика не дает преимуществ и, более того, ухудшает результат.
In decision theory and estimation theory, Stein's example (also known as Stein's phenomenon or Stein's paradox) is the observation that when three or more parameters are estimated simultaneously, there exist combined estimators more accurate on average (that is, having lower expected mean squared error) than any method that handles the parameters separately. It is named after Charles Stein of Stanford University, who discovered the phenomenon in 1955. An intuitive explanation is that optimizing for the mean squared error of a combined estimator is not the same as optimizing for the errors of separate estimators of the individual parameters. In practical terms, if the combined error is in fact of interest, then a combined estimator should be used, even if the underlying parameters are independent. If one is instead interested in estimating an individual parameter, then using a combined estimator does not help and is in fact worse.
Официальное заявление
Ниже приведена наиболее простая форма парадокса, частный случай, когда число наблюдений равно числу оцениваемых параметров. Пусть – вектор, состоящий из неизвестных параметров. Для оценки этих параметров выполняется одно измерение для каждого параметра, в результате чего получается вектор длиной . Предположим, что измерения являются независимыми гауссовскими случайными величинами со средним и дисперсией 1, то есть . Таким образом, каждый параметр оценивается с использованием единственного зашумленного измерения, и каждое измерение имеет одинаковую точность. В этих условиях интуитивно и обычно использовать каждое измерение в качестве оценки соответствующего параметра. Это так называемое "обычное" правило принятия решений можно записать как , которое является оценкой максимального правдоподобия (MLE). Качество такого оценщика измеряется его функцией риска. Обычно используемой функцией риска является среднеквадратичная ошибка, определяемая как Удивительно, но оказывается, что "обычное" правило принятия решений неоптимально (недопустимо) с точки зрения среднеквадратичной ошибки при . Иными словами, в рассматриваемой ситуации существуют альтернативные оценщики, которые всегда достигают меньшей среднеквадратичной ошибки, независимо от значения . Для заданного можно, очевидно, определить идеальный "оценщик", который всегда равен , но этот оценщик будет плох для других значений .
Оценщики парадокса Стейна, для заданного , лучше, чем "обычное" правило принятия решений для некоторых , но обязательно хуже для других. Они лучше только в среднем. Более точно, оценщик доминирует над другим оценщиком , если для всех значений риск меньше или равен риску , и если неравенство строго для некоторых . Оценщик считается допустимым, если над ним не доминирует ни один другой оценщик, в противном случае он недопустим. Таким образом, пример Стейна можно сформулировать следующим образом: "обычное" правило принятия решений относительно среднего многомерного гауссовского распределения недопустимо при риске среднеквадратичной ошибки. Многие простые, практические оценщики демонстрируют лучшие результаты, чем "обычное" правило принятия решений. Наиболее известным примером является оценщик Джеймса–Стейна, который "стягивает" к определенной точке (например, к началу координат) на величину, обратно пропорциональную расстоянию от этой точки. См. схему доказательства этого результата в разделе Доказательство примера Стейна. Альтернативное доказательство принадлежит Ларри Брауну: он доказал, что обычный оценщик для -мерного вектора среднего нормального распределения допустим тогда и только тогда, когда -мерное броуновское движение рекуррентно. Поскольку броуновское движение не рекуррентно при , MLE недопустимо при .
Интуитивное объяснение
Для любого конкретного значения нового оценщика улучшится по крайней мере одна из индивидуальных средних квадратичных ошибок. Это несложно – например, если находится между −1 и 1, а , то оценщик, который линейно сжимает к 0 на 0.5 (т.е., , мягкая пороговая обработка с порогом), будет иметь меньшую среднюю квадратичную ошибку, чем сама . Но существуют и другие значения , для которых этот оценщик хуже, чем сама . Смысл оценщика Штейна и других, приводящих к парадоксу Штейна, заключается в том, что они корректируют смещение таким образом, что всегда (для любого вектора) найдется по крайней мере одна компонента, чья средняя квадратичная ошибка уменьшается, и это улучшение более чем компенсирует любое возможное ухудшение средней квадратичной ошибки для другой компоненты. Проблема в том, что, не зная , невозможно определить, какие именно средние квадратичные ошибки улучшены, и поэтому нельзя использовать оценщик Штейна только для тех параметров. Пример подобной ситуации возникает при оценке каналов в телекоммуникациях, поскольку на общую производительность канала влияют различные факторы.
Последствия
Пример Штейна удивляет, поскольку "обычное" правило принятия решений интуитивно понятно и широко используется. На самом деле, множество методов построения оценок, включая оценку максимального правдоподобия, наилучшую линейную несмещенную оценку, метод наименьших квадратов и оптимальную эквивариантную оценку, приводят к "обычной" оценке. Тем не менее, как обсуждалось выше, эта оценка является субоптимальной.
Пример
Чтобы продемонстрировать неинтуитивность примера Штейна, рассмотрим следующий пример из реальной жизни. Предположим, нам необходимо оценить три не связанных между собой параметра, например, урожайность пшеницы в США в 1993 году, количество зрителей на теннисном турнире в Уимблдоне в 2001 году и вес случайно выбранного шоколадного батончика в супермаркете. Предположим, у нас есть независимые гауссовские измерения каждой из этих величин. Пример Штейна показывает, что мы можем получить более точную оценку (в среднем) для вектора из трех параметров, одновременно используя все три несвязанных измерения. На первый взгляд может показаться, что мы улучшаем оценку урожайности пшеницы в США, измеряя совершенно другие показатели, такие как количество зрителей на Уимблдоне и вес шоколадного батончика. Однако мы не получили лучшую оценку урожайности пшеницы в США как таковой, а получили оценку для вектора средних значений всех трех случайных величин, которая имеет сниженный суммарный риск. Это происходит потому, что ошибка в оценке одного компонента вектора компенсируется более точной оценкой другого компонента. Кроме того, конкретный набор из трех оцененных средних значений, полученный с помощью нового оценщика, не обязательно будет лучше обычного набора (измеренных значений). Новый оценщик лучше только в среднем.