Введение
Диагностический график способности бинарного классификатора
ROC-кривая, или кривая рабочей характеристики приемника, – это графическое представление, иллюстрирующее производительность модели бинарного классификатора (которая также может использоваться для многоклассовой классификации) при различных пороговых значениях. ROC-кривая представляет собой график истинноположительной доли (TPR) в зависимости от ложноположительной доли (FPR) для каждого установленного порога. ROC-кривую также можно рассматривать как график статистической мощности в зависимости от ошибки первого рода правила принятия решений (когда производительность оценивается только по выборке из генеральной совокупности, ее можно интерпретировать как оценки этих величин). Таким образом, ROC-кривая отражает чувствительность или полноту в зависимости от ложноположительной доли. Если известны вероятностные распределения для истинноположительных и ложноположительных результатов, ROC-кривая получается как функция кумулятивного распределения (CDF, площадь под функцией распределения вероятностей от точки дискриминации до бесконечности) вероятности обнаружения по оси Y в зависимости от CDF вероятности ложноположительного результата по оси X. ROC-анализ предоставляет инструменты для выбора потенциально оптимальных моделей и отбраковки неоптимальных, независимо от (и до определения) контекста стоимости или распределения классов. ROC-анализ тесно и естественно связан с анализом затрат и выгод при принятии диагностических решений.
Терминология
Истинноположительная доля также известна как чувствительность, полнота или вероятность обнаружения. Ложноположительная доля также известна как вероятность ложной тревоги.
История
Кривая ROC была впервые разработана инженерами-электриками и инженерами радиолокации во время Второй мировой войны для обнаружения вражеских объектов на поле боя, начиная с 1941 года, что и обусловило её название ("характеристика рабочей кривой приемника"). Вскоре она была применена в психологии для анализа восприятия стимулов. С тех пор ROC-анализ на протяжении многих десятилетий используется в медицине, радиологии, биометрии, прогнозировании природных катастроф, метеорологии, оценке эффективности моделей и других областях, а также всё шире применяется в исследованиях машинного обучения и интеллектуального анализа данных.
Основная концепция
Классификационная модель (классификатор или диагностика) представляет собой отображение экземпляров между определенными классами/группами. Поскольку результат классификатора или диагностики может быть произвольным вещественным числом (непрерывный выход), граница классификатора между классами должна определяться пороговым значением (например, для определения наличия гипертонии у человека на основе измерения артериального давления). Или это может быть дискретная метка класса, указывающая на один из классов. Рассмотрим задачу предсказания для двух классов (бинарная классификация), в которой результаты обозначаются как положительные (p) или отрицательные (n). Существует четыре возможных исхода от бинарного классификатора. Если результат предсказания равен p, а фактическое значение также равно p, то это называется истинно-положительным (TP); однако, если фактическое значение равно n, то это называется ложно-положительным (FP). И наоборот, истинно-отрицательный (TN) результат возникает, когда и результат предсказания, и фактическое значение равны n, а ложно-отрицательный (FN) результат – когда результат предсказания равен n, а фактическое значение равно p. Чтобы привести подходящий пример из реальной задачи, рассмотрим диагностический тест, предназначенный для определения наличия у человека определенного заболевания. Ложноположительный результат в этом случае возникает, когда тест показывает положительный результат, но на самом деле у человека нет этого заболевания. Ложноотрицательный результат, с другой стороны, возникает, когда тест показывает отрицательный результат, указывая на отсутствие заболевания, хотя на самом деле оно присутствует. Рассмотрим эксперимент с P положительными и N отрицательными экземплярами для некоторого признака. Четыре исхода можно представить в виде таблицы сопряженности 2×2 или матрицы ошибок следующим образом:
To get an appropriate example in a real world problem, consider a diagnostic test that seeks to determine whether a person has a certain disease. A false positive in this case occurs when the person tests positive, but does not actually have the disease. A false negative, on the other hand, occurs when the person tests negative, suggesting they are healthy, when they actually do have the disease. Consider an experiment from P positive instances and N negative instances for some condition. The four outcomes can be formulated in a 2×2 contingency table or confusion matrix, as follows:
Кривые в пространстве ROC
В бинарной классификации предсказание класса для каждого экземпляра часто делается на основе непрерывной случайной переменной, которая является "оценкой", вычисленной для экземпляра (например, оценка вероятности в логистической регрессии). При заданном пороговом параметре θ, экземпляр классифицируется как "положительный", если x > θ, и "отрицательный" в противном случае. x следует плотности вероятности p(x|y=1), если экземпляр действительно принадлежит к классу "положительный", и p(x|y=0) – если нет. Следовательно, истинноположительная доля (True Positive Rate) задается выражением TPR = P(x > θ | y = 1), а ложноположительная доля (False Positive Rate) – выражением FPR = P(x > θ | y = 0). Кривая ROC отображает параметрически TPR в зависимости от FPR, при этом θ является изменяющимся параметром. Например, представьте, что уровень белка в крови у больных и здоровых людей имеет нормальное распределение со средними значениями 2 г/дл и 1 г/дл соответственно. Медицинский тест может измерять уровень определенного белка в образце крови и классифицировать любое значение выше определенного порога как указывающее на наличие заболевания. Исследователь может регулировать порог (зеленая вертикальная линия на рисунке), что, в свою очередь, изменит ложноположительную долю. Увеличение порога приведет к уменьшению числа ложных положительных результатов (и увеличению числа ложных отрицательных), что соответствует движению влево по кривой. Фактическая форма кривой определяется степенью перекрытия двух распределений.
The ROC curve plots parametrically versus with as the varying parameter. For example, imagine that the blood protein levels in diseased people and healthy people are normally distributed with means of 2 g/dL and 1 g/dL respectively. A medical test might measure the level of a certain protein in a blood sample and classify any number above a certain threshold as indicating disease. The experimenter can adjust the threshold (green vertical line in the figure), which will in turn change the false positive rate. Increasing the threshold would result in fewer false positives (and more false negatives), corresponding to a leftward movement on the curve. The actual shape of the curve is determined by how much overlap the two distributions have.
Z-оценка
Если к кривой ROC применяется стандартный балл, кривая преобразуется в прямую линию. Этот z-балл основан на нормальном распределении со средним значением, равным нулю, и стандартным отклонением, равным единице. В теории силы памяти необходимо исходить из того, что zROC не только линейна, но и имеет наклон 1.0. Нормальное распределение целей (изученных объектов, которые испытуемые должны вспомнить) и отвлекающих факторов (неизученных объектов, которые испытуемые пытаются вспомнить) является фактором, определяющим линейность zROC. Линейность кривой zROC зависит от стандартных отклонений распределений силы целей и отвлекающих факторов. Если стандартные отклонения равны, наклон будет равен 1.0. Если стандартное отклонение распределения силы целей больше, чем стандартное отклонение распределения силы отвлекающих факторов, то наклон будет меньше 1.0. В большинстве исследований было обнаружено, что наклон кривой zROC постоянно снижается ниже 1, обычно находясь в диапазоне от 0.5 до 0.9. Многие эксперименты показали наклон zROC, равный 0.8. Наклон 0.8 указывает на то, что изменчивость распределения силы целей на 25% больше, чем изменчивость распределения силы отвлекающих факторов. Другой используемый показатель – d' (d-штрих) (обсуждается выше в разделе «Другие показатели»), который можно легко выразить через z-значения. Хотя d' является широко используемым параметром, следует признать, что он имеет значение только при строгом соблюдении очень сильных предположений теории силы памяти, сформулированных выше. Z-оценка кривой ROC всегда линейна, как предполагается, за исключением особых случаев. Модель узнавания на основе знакомства и воспоминания Йонелина представляет собой двухмерное описание памяти узнавания. Вместо того, чтобы испытуемый просто отвечал «да» или «нет» на конкретный стимул, он приписывает стимулу ощущение знакомства, которое функционирует как исходная кривая ROC. Однако изменяется параметр, отвечающий за Воспоминание (R). Воспоминание предполагается «либо-либо», и оно превосходит знакомство. Если бы не было компонента воспоминания, zROC имел бы прогнозируемый наклон 1. Однако при добавлении компонента воспоминания кривая zROC будет вогнутой вверх, с уменьшенным наклоном. Эта разница в форме и наклоне является результатом добавления элемента изменчивости, связанного с тем, что некоторые стимулы были вспомнены. Пациенты с антероградной амнезией не способны вспоминать, поэтому их кривая zROC Йонелина будет иметь наклон, близкий к 1.0.
История
Кривая ROC была впервые использована во время Второй мировой войны для анализа радиолокационных сигналов, до того как нашла применение в теории обнаружения сигналов. После нападения на Перл-Харбор в 1941 году вооруженные силы США начали новые исследования с целью повышения точности определения японских самолетов по радиолокационным сигналам. Для этого они измеряли способность оператора радиолокационного приемника различать эти важные сигналы, что получило название "характеристика рабочей кривой приемника" (Receiver Operating Characteristic). В 1950-х годах кривые ROC стали использоваться в психофизике для оценки способности человека (и иногда животных) обнаруживать слабые сигналы. Кривые ROC также широко применяются в эпидемиологии и медицинских исследованиях и часто упоминаются в контексте доказательной медицины. В радиологии ROC-анализ является распространенным методом оценки новых радиологических методов. В социальных науках ROC-анализ часто называют "коэффициентом точности ROC", который является распространенным методом оценки точности моделей вероятности дефолта. Кривые ROC широко используются в лабораторной медицине для оценки диагностической точности теста, выбора оптимального порогового значения и сравнения диагностической точности нескольких тестов. Кривые ROC также оказались полезными для оценки методов машинного обучения. Первым ROC в машинном обучении применил Спакман, который продемонстрировал ценность кривых ROC при сравнении и оценке различных алгоритмов классификации. Кривые ROC также используются для верификации прогнозов в метеорологии.
Радар в деталях
Как уже упоминалось, ROC-кривые критически важны для работы и теории радаров. Сигналы, принимаемые на приемной станции, отраженные от цели, часто имеют очень низкую энергию по сравнению с уровнем шума. Отношение сигнал/шум является важной метрикой при определении вероятности обнаружения цели. Это отношение сигнал/шум напрямую связано с характеристиками работы приемника всей радиолокационной системы, которые используются для количественной оценки ее возможностей. Рассмотрим разработку радиолокационной системы. Спецификация ее возможностей может быть задана в терминах вероятности обнаружения, с определенной допустимой вероятностью ложных тревог. Упрощенное приближение требуемого отношения сигнал/шум на приемной станции можно вычислить, решив уравнение относительно отношения сигнал/шум. Здесь отношение сигнал/шум выражено не в децибелах, как это обычно делается во многих радиолокационных приложениях. Перевод в децибелы осуществляется по формуле. На основе этого значения можно решить стандартные уравнения радиолокационного диапазона (с учетом коэффициентов шума) для оценки необходимой эффективной излучаемой мощности.
for the signal to noise ratio Here, is not in decibels, as is common in many radar applications. Conversion to decibels is through From this figure, the common entries in the radar range equation (with noise factors) may be solved, to estimate the required effective radiated power.
Кривые ROC, не относящиеся к бинарной классификации
Расширение кривых ROC для задач классификации с более чем двумя классами является сложным. Два распространенных подхода при наличии нескольких классов: (1) усреднение по всем парным значениям AUC и (2) вычисление объема под поверхностью (VUS). Для усреднения по всем парным классам вычисляется AUC для каждой пары классов, используя только примеры из этих двух классов, как если бы других классов не существовало, а затем эти значения AUC усредняются по всем возможным парам. Если имеется c классов, то будет c(c − 1) / 2 возможных пар классов. Подход с вычислением объема под поверхностью предполагает построение гиперповерхности вместо кривой и последующее измерение гиперобъема под этой гиперповерхностью. Любое возможное правило принятия решения, которое может быть использовано для классификатора с c классами, можно описать с точки зрения его истинных положительных частот. Этот набор частот определяет точку, а множество всех возможных правил принятия решений формирует облако точек, определяющее гиперповерхность. При таком определении VUS представляет собой вероятность того, что классификатор сможет правильно классифицировать все c примеров, если ему будет предоставлен набор, содержащий один случайно выбранный пример из каждого класса. Реализация классификатора, который знает, что его входной набор состоит из одного примера из каждого класса, может сначала вычислить оценку качества соответствия для каждой возможной комбинации примера и класса, а затем использовать венгерский алгоритм для максимизации суммы c выбранных оценок по всем c! возможным способам назначения каждому классу ровно одного примера. Учитывая успех кривых ROC в оценке моделей классификации, также было исследовано расширение кривых ROC для других задач обучения с учителем. Заметными предложениями для задач регрессии являются так называемые кривые характеристики ошибки регрессии (REC) и кривые регрессионной ROC (RROC). В последнем случае кривые RROC становятся чрезвычайно похожими на кривые ROC для классификации, с понятиями асимметрии, доминирования и выпуклой оболочки. Кроме того, площадь под кривыми RROC пропорциональна дисперсии ошибки регрессионной модели.