Введение
Измерение точности вероятностных прогнозов Брайер-оценка - это строго правильная функция оценки или строго правильное правило оценки, которое измеряет точность вероятностных прогнозов. Для одномерных предсказаний она строго эквивалентна средней квадратной ошибке, применяемой к предсказанным вероятностям. Оценка Бриера применима к задачам, в которых предсказания должны присваивать вероятности набору взаимоисключающих дискретных результатов или классов. Набор возможных результатов может быть либо бинарным, либо категорическим по своей природе, и вероятности, присвоенные этому набору результатов, должны быть равны одному (где каждая отдельная вероятность находится в диапазоне от 0 до 1). Он был предложен Гленном В. Бриером в 1950 году. Оценку Бриера можно рассматривать как функцию затрат. Более точно, по всем пунктам в наборе N прогнозов, балл Бриера измеряет среднюю квадратную разницу между: Прогнозируемая вероятность, присвоенная возможным результатам для пункта i Фактический результат Следовательно, чем ниже балл Бриера для набора прогнозов, тем лучше прогнозы калиброваны. Обратите внимание, что балл Бриера, в его наиболее распространенной формулировке, принимает значение от нуля до одного, поскольку это квадрат наибольшей возможной разницы между прогнозируемой вероятностью (которая должна быть от нуля до одного) и фактическим результатом (который может принимать значения только 0 или 1). В оригинальной формулировке (1950) балла Бриера диапазон двойной, от нуля до двух. Оценка Бриера подходит для бинарных и категорических результатов, которые могут быть структурированы как истинные или ложные, но она не подходит для порядковых переменных, которые могут принимать три или более значения.
The Brier Score is a strictly proper score function or strictly proper scoring rule that measures the accuracy of probabilistic predictions. For unidimensional predictions, it is strictly equivalent to the mean squared error as applied to predicted probabilities. The Brier score is applicable to tasks in which predictions must assign probabilities to a set of mutually exclusive discrete outcomes or classes. The set of possible outcomes can be either binary or categorical in nature, and the probabilities assigned to this set of outcomes must sum to one (where each individual probability is in the range of 0 to 1). It was proposed by Glenn W. Brier in 1950. The Brier score can be thought of as a cost function. More precisely, across all items in a set of N predictions, the Brier score measures the mean squared difference between:
The predicted probability assigned to the possible outcomes for item i
The actual outcome
Therefore, the lower the Brier score is for a set of predictions, the better the predictions are calibrated. Note that the Brier score, in its most common formulation, takes on a value between zero and one, since this is the square of the largest possible difference between a predicted probability (which must be between zero and one) and the actual outcome (which can take on values of only 0 or 1). In the original (1950) formulation of the Brier score, the range is double, from zero to two. The Brier score is appropriate for binary and categorical outcomes that can be structured as true or false, but it is inappropriate for ordinal variables which can take on three or more values.
Пример
Предположим, что кто-то прогнозирует вероятность того, что в определенный день будет дождь. Затем оценка Brier рассчитывается следующим образом: если прогноз составляет 100% (=1) и идет дождь, то оценка Brier равна 0, наилучшая возможная оценка. Если прогноз 100%, и не будет дождя, то оценка Бриера равна 1, наихудшая оценка, которую можно достичь. Если прогноз составляет 70% (= 0,70) и идет дождь, то оценка Бриера составляет (0,70−1) 2 = 0,09. Напротив, если прогноз составляет 70% (= 0,70) и не идет дождь, то оценка Бриера составляет (0,70−0) 2 = 0,49. Аналогичным образом, если прогноз составляет 30% (=0,30) и идет дождь, то оценка Бриера составляет (0,30−1) 2 = 0,49. Если прогноз составляет 50% (= 0,50), то балл Бриера составляет (0,50−1) 2 = (0,50−0) 2 = 0,25, независимо от того, будет ли идти дождь.
If the forecast is 100% ( = 1) and it rains, then the Brier Score is 0, the best score achievable. If the forecast is 100% and it does not rain, then the Brier Score is 1, the worst score achievable. If the forecast is 70% ( = 0.70) and it rains, then the Brier Score is (0.70−1)2 = 0.09. In contrast, if the forecast is 70% ( = 0.70) and it does not rain, then the Brier Score is (0.70−0)2 = 0.49. Similarly, if the forecast is 30% ( = 0.30) and it rains, then the Brier Score is (0.30−1)2 = 0.49. If the forecast is 50% ( = 0.50), then the Brier score is (0.50−1)2 = (0.50−0)2 = 0.25, regardless of whether it rains.
Надежность
Термин надежности измеряет, насколько близки вероятности прогноза к истинным вероятностям, учитывая этот прогноз. Надежность определяется в противоположном направлении по сравнению с английским языком. Если надежность равна 0, прогноз является совершенно надежным. Например, если мы группируем все прогнозные случаи, когда прогнозировалась вероятность дождя в 80%, мы получаем идеальную надежность только в том случае, если после такого прогноза выпало дождь 4 из 5 раз.
Резолюция
Термин "резолюция" измеряет, насколько условные вероятности, данные различными прогнозами, отличаются от климатической средней. Чем выше этот термин, тем лучше. В худшем случае, когда климатическая вероятность всегда прогнозируется, разрешение равняется нулю. В лучшем случае, когда условные вероятности равны нулю и единице, разрешение равно неопределенности.
Неопределенность
Термин неопределенности измеряет присущую неопределенность в результатах события. Для бинарных событий она максимальна, когда каждый результат происходит 50% времени, и минимальна (нулевая), если результат всегда происходит или никогда не происходит.
Двухкомпонентный разложение
Альтернативное (и связанное) разложение генерирует два термина вместо трех. Первый термин известен как калибровка (и может использоваться в качестве меры калибровки, см. статистическую калибровку), и равен надежности. Второй термин известен как уточнение, и это агрегация разрешения и неопределенности, и связано с площадью под кривой ROC. Показатель Brier и разложение CAL + REF можно представить графически с помощью так называемых кривых Brier, где ожидаемые потери показываются для каждого рабочего состояния. Это делает оценку Бриера мерой совокупной производительности при равномерном распределении классовой асимметрии.
Оценка навыков Brier (BSS)
Оценка навыка для данного базового балла является смещенным и (отрицательно) масштабированным вариантом базового балла, таким образом, что значение балла навыка равняется нулю, а это означает, что оценка для прогнозов является такой же хорошей, как и для набора базовых или референтных или стандартных прогнозов, в то время как значение балла навыка равняется одному (100%) и представляет собой наилучшую возможную оценку. Значение оценки навыка менее нуля означает, что производительность даже хуже, чем в базовых или референтных прогнозах. Когда базовым баллом является балл Бриера (BS), балл Brier Skill (BSS) рассчитывается как где находится балл Brier для базовых прогнозов, которые мы стремимся улучшить. В то время как эталонные прогнозы в принципе могут быть даны любой существующей моделью, по умолчанию можно использовать наивную модель, которая прогнозирует общую пропорцию или частоту данного класса в наборе данных, оцениваемом как постоянная прогнозируемая вероятность того, что этот класс возникает в каждом экземпляре набора данных. Эта базовая модель будет представлять собой модель "без навыков", которую можно улучшить. Оценка навыков происходит из литературы по прогнозированию погоды, где наивные стандартные справочные прогнозы называются прогнозами "в образцовой климатологии", где климатология означает долгосрочное или общее среднее прогноза погоды, а в образцовом среднем, как рассчитано из текущего набора данных, набравшего балл. В этом случае по умолчанию для двоичной (двух классов) классификации, эталонный балл Бриера дается (используя обозначение первого уравнения этой статьи, в верхней части раздела "Определение"): где просто средний фактический результат, т.е. общая доля истинного класса 1 в наборе данных: С баллом Бриера, ниже лучше (это функция потери), при этом 0 является лучшим возможным баллом. Но с оценкой навыка Brier, более высокий - лучше, а 1 (100%) - лучший возможный балл. Оценка навыков Бриера может быть более понятной, чем оценка Бриера, потому что BSS - это просто процентное улучшение BS по сравнению с эталонной моделью, а отрицательная BSS означает, что вы делаете еще хуже, чем эталонная модель, что может быть не очевидно при рассмотрении самой оценки Бриера. Однако, BSS около 100% не следует ожидать, потому что это потребует, чтобы каждый прогноз вероятности был почти 0 или 1 (и был правильным, конечно). Поскольку оценка Бриера является строго правильным правилом оценки, а BSS - это только аффинное преобразование, BSS также является строго правильным правилом оценки. Вы можете заметить, что BSS классификации (оценки вероятности) является его BS, как коэффициент определения регрессии является его средней квадратной ошибкой (MSE).
where is the Brier score of reference or baseline predictions which we seek to improve on. While the reference predictions could in principle be given by any pre existing model, by default one can use the naïve model that predicts the overall proportion or frequency of a given class in the data set being scored, as the constant predicted probability of that class occurring in each instance in the data set. This baseline model would represent a "no skill" model that one seeks to improve on. Skill scores originate in the meteorological prediction literature, where the naïve default reference predictions are called the "in sample climatology" predictions, where climatology means a long term or overall average of weather predictions, and in sample means as calculated from the present data set being scored. In this default case, for binary (two class) classification, the reference Brier score is given by (using the notation of the first equation of this article, at the top of the Definition section):
where is simply the average actual outcome, i. e. the overall proportion of true class 1 in the data set:
With a Brier score, lower is better (it is a loss function) with 0 being the best possible score. But with a Brier skill score, higher is better with 1 (100%) being the best possible score. The Brier skill score can be more interpretable than the Brier score because the BSS is simply the percentage improvement in the BS compared to the reference model, and a negative BSS means you are doing even worse than the reference model, which may not be obvious from looking at the Brier score itself. However, a BSS near 100% should not typically be expected because this would require that every probability prediction was nearly 0 or 1 (and was correct of course). Because the Brier score is a strictly proper scoring rule, and the BSS is just an affine transformation of it, the BSS is also a strictly proper scoring rule. You might notice that classification's (probability estimation's) BSS is to its BS, as regression's coefficient of determination is to its mean squared error (MSE).
Недостатки
Показатель Бриера становится неадекватным для очень редких (или очень частых) событий, потому что он недостаточно различает небольшие изменения в прогнозе, которые являются значимыми для редких событий. Wilks (2010) обнаружил, что "для прогнозов относительно редких событий с высоким уровнем квалификации требуются очень большие размеры выборки, т.е. n > 1000, тогда как для прогнозов с низким уровнем квалификации обычных событий требуются только довольно скромные размеры выборки".
sample sizes, i. e. n > 1000, are required for higher skill forecasts of relatively rare events, whereas only quite modest sample sizes are needed for low skill forecasts of common events."