Введение

Диагностический график способности бинарного классификатора

ROC-кривая, или кривая рабочей характеристики приемника, – это графическое представление, иллюстрирующее производительность модели бинарного классификатора (которая также может использоваться для многоклассовой классификации) при различных пороговых значениях. ROC-кривая представляет собой график истинноположительной доли (TPR) в зависимости от ложноположительной доли (FPR) для каждого установленного порога. ROC-кривую также можно рассматривать как график статистической мощности в зависимости от ошибки первого рода правила принятия решений (когда производительность оценивается только по выборке из генеральной совокупности, ее можно интерпретировать как оценки этих величин). Таким образом, ROC-кривая отражает чувствительность или полноту в зависимости от ложноположительной доли. Если известны вероятностные распределения для истинноположительных и ложноположительных результатов, ROC-кривая получается как функция кумулятивного распределения (CDF, площадь под функцией распределения вероятностей от точки дискриминации до бесконечности) вероятности обнаружения по оси Y в зависимости от CDF вероятности ложноположительного результата по оси X. ROC-анализ предоставляет инструменты для выбора потенциально оптимальных моделей и отбраковки неоптимальных, независимо от (и до определения) контекста стоимости или распределения классов. ROC-анализ тесно и естественно связан с анализом затрат и выгод при принятии диагностических решений.

Терминология

Истинноположительная доля также известна как чувствительность, полнота или вероятность обнаружения. Ложноположительная доля также известна как вероятность ложной тревоги.

История

Кривая ROC была впервые разработана инженерами-электриками и инженерами радиолокации во время Второй мировой войны для обнаружения вражеских объектов на поле боя, начиная с 1941 года, что и обусловило её название ("характеристика рабочей кривой приемника"). Вскоре она была применена в психологии для анализа восприятия стимулов. С тех пор ROC-анализ на протяжении многих десятилетий используется в медицине, радиологии, биометрии, прогнозировании природных катастроф, метеорологии, оценке эффективности моделей и других областях, а также всё шире применяется в исследованиях машинного обучения и интеллектуального анализа данных.

Основная концепция

Классификационная модель (классификатор или диагностика) представляет собой отображение экземпляров между определенными классами/группами. Поскольку результат классификатора или диагностики может быть произвольным вещественным числом (непрерывный выход), граница классификатора между классами должна определяться пороговым значением (например, для определения наличия гипертонии у человека на основе измерения артериального давления). Или это может быть дискретная метка класса, указывающая на один из классов. Рассмотрим задачу предсказания для двух классов (бинарная классификация), в которой результаты обозначаются как положительные (p) или отрицательные (n). Существует четыре возможных исхода от бинарного классификатора. Если результат предсказания равен p, а фактическое значение также равно p, то это называется истинно-положительным (TP); однако, если фактическое значение равно n, то это называется ложно-положительным (FP). И наоборот, истинно-отрицательный (TN) результат возникает, когда и результат предсказания, и фактическое значение равны n, а ложно-отрицательный (FN) результат – когда результат предсказания равен n, а фактическое значение равно p. Чтобы привести подходящий пример из реальной задачи, рассмотрим диагностический тест, предназначенный для определения наличия у человека определенного заболевания. Ложноположительный результат в этом случае возникает, когда тест показывает положительный результат, но на самом деле у человека нет этого заболевания. Ложноотрицательный результат, с другой стороны, возникает, когда тест показывает отрицательный результат, указывая на отсутствие заболевания, хотя на самом деле оно присутствует. Рассмотрим эксперимент с P положительными и N отрицательными экземплярами для некоторого признака. Четыре исхода можно представить в виде таблицы сопряженности 2×2 или матрицы ошибок следующим образом:

Кривые в пространстве ROC

В бинарной классификации предсказание класса для каждого экземпляра часто делается на основе непрерывной случайной переменной, которая является "оценкой", вычисленной для экземпляра (например, оценка вероятности в логистической регрессии). При заданном пороговом параметре θ, экземпляр классифицируется как "положительный", если x > θ, и "отрицательный" в противном случае. x следует плотности вероятности p(x|y=1), если экземпляр действительно принадлежит к классу "положительный", и p(x|y=0) – если нет. Следовательно, истинноположительная доля (True Positive Rate) задается выражением TPR = P(x > θ | y = 1), а ложноположительная доля (False Positive Rate) – выражением FPR = P(x > θ | y = 0). Кривая ROC отображает параметрически TPR в зависимости от FPR, при этом θ является изменяющимся параметром. Например, представьте, что уровень белка в крови у больных и здоровых людей имеет нормальное распределение со средними значениями 2 г/дл и 1 г/дл соответственно. Медицинский тест может измерять уровень определенного белка в образце крови и классифицировать любое значение выше определенного порога как указывающее на наличие заболевания. Исследователь может регулировать порог (зеленая вертикальная линия на рисунке), что, в свою очередь, изменит ложноположительную долю. Увеличение порога приведет к уменьшению числа ложных положительных результатов (и увеличению числа ложных отрицательных), что соответствует движению влево по кривой. Фактическая форма кривой определяется степенью перекрытия двух распределений.

Z-оценка

Если к кривой ROC применяется стандартный балл, кривая преобразуется в прямую линию. Этот z-балл основан на нормальном распределении со средним значением, равным нулю, и стандартным отклонением, равным единице. В теории силы памяти необходимо исходить из того, что zROC не только линейна, но и имеет наклон 1.0. Нормальное распределение целей (изученных объектов, которые испытуемые должны вспомнить) и отвлекающих факторов (неизученных объектов, которые испытуемые пытаются вспомнить) является фактором, определяющим линейность zROC. Линейность кривой zROC зависит от стандартных отклонений распределений силы целей и отвлекающих факторов. Если стандартные отклонения равны, наклон будет равен 1.0. Если стандартное отклонение распределения силы целей больше, чем стандартное отклонение распределения силы отвлекающих факторов, то наклон будет меньше 1.0. В большинстве исследований было обнаружено, что наклон кривой zROC постоянно снижается ниже 1, обычно находясь в диапазоне от 0.5 до 0.9. Многие эксперименты показали наклон zROC, равный 0.8. Наклон 0.8 указывает на то, что изменчивость распределения силы целей на 25% больше, чем изменчивость распределения силы отвлекающих факторов. Другой используемый показатель – d' (d-штрих) (обсуждается выше в разделе «Другие показатели»), который можно легко выразить через z-значения. Хотя d' является широко используемым параметром, следует признать, что он имеет значение только при строгом соблюдении очень сильных предположений теории силы памяти, сформулированных выше. Z-оценка кривой ROC всегда линейна, как предполагается, за исключением особых случаев. Модель узнавания на основе знакомства и воспоминания Йонелина представляет собой двухмерное описание памяти узнавания. Вместо того, чтобы испытуемый просто отвечал «да» или «нет» на конкретный стимул, он приписывает стимулу ощущение знакомства, которое функционирует как исходная кривая ROC. Однако изменяется параметр, отвечающий за Воспоминание (R). Воспоминание предполагается «либо-либо», и оно превосходит знакомство. Если бы не было компонента воспоминания, zROC имел бы прогнозируемый наклон 1. Однако при добавлении компонента воспоминания кривая zROC будет вогнутой вверх, с уменьшенным наклоном. Эта разница в форме и наклоне является результатом добавления элемента изменчивости, связанного с тем, что некоторые стимулы были вспомнены. Пациенты с антероградной амнезией не способны вспоминать, поэтому их кривая zROC Йонелина будет иметь наклон, близкий к 1.0.

История

Кривая ROC была впервые использована во время Второй мировой войны для анализа радиолокационных сигналов, до того как нашла применение в теории обнаружения сигналов. После нападения на Перл-Харбор в 1941 году вооруженные силы США начали новые исследования с целью повышения точности определения японских самолетов по радиолокационным сигналам. Для этого они измеряли способность оператора радиолокационного приемника различать эти важные сигналы, что получило название "характеристика рабочей кривой приемника" (Receiver Operating Characteristic). В 1950-х годах кривые ROC стали использоваться в психофизике для оценки способности человека (и иногда животных) обнаруживать слабые сигналы. Кривые ROC также широко применяются в эпидемиологии и медицинских исследованиях и часто упоминаются в контексте доказательной медицины. В радиологии ROC-анализ является распространенным методом оценки новых радиологических методов. В социальных науках ROC-анализ часто называют "коэффициентом точности ROC", который является распространенным методом оценки точности моделей вероятности дефолта. Кривые ROC широко используются в лабораторной медицине для оценки диагностической точности теста, выбора оптимального порогового значения и сравнения диагностической точности нескольких тестов. Кривые ROC также оказались полезными для оценки методов машинного обучения. Первым ROC в машинном обучении применил Спакман, который продемонстрировал ценность кривых ROC при сравнении и оценке различных алгоритмов классификации. Кривые ROC также используются для верификации прогнозов в метеорологии.

Радар в деталях

Как уже упоминалось, ROC-кривые критически важны для работы и теории радаров. Сигналы, принимаемые на приемной станции, отраженные от цели, часто имеют очень низкую энергию по сравнению с уровнем шума. Отношение сигнал/шум является важной метрикой при определении вероятности обнаружения цели. Это отношение сигнал/шум напрямую связано с характеристиками работы приемника всей радиолокационной системы, которые используются для количественной оценки ее возможностей. Рассмотрим разработку радиолокационной системы. Спецификация ее возможностей может быть задана в терминах вероятности обнаружения, с определенной допустимой вероятностью ложных тревог. Упрощенное приближение требуемого отношения сигнал/шум на приемной станции можно вычислить, решив уравнение относительно отношения сигнал/шум. Здесь отношение сигнал/шум выражено не в децибелах, как это обычно делается во многих радиолокационных приложениях. Перевод в децибелы осуществляется по формуле. На основе этого значения можно решить стандартные уравнения радиолокационного диапазона (с учетом коэффициентов шума) для оценки необходимой эффективной излучаемой мощности.

Кривые ROC, не относящиеся к бинарной классификации

Расширение кривых ROC для задач классификации с более чем двумя классами является сложным. Два распространенных подхода при наличии нескольких классов: (1) усреднение по всем парным значениям AUC и (2) вычисление объема под поверхностью (VUS). Для усреднения по всем парным классам вычисляется AUC для каждой пары классов, используя только примеры из этих двух классов, как если бы других классов не существовало, а затем эти значения AUC усредняются по всем возможным парам. Если имеется c классов, то будет c(c − 1) / 2 возможных пар классов. Подход с вычислением объема под поверхностью предполагает построение гиперповерхности вместо кривой и последующее измерение гиперобъема под этой гиперповерхностью. Любое возможное правило принятия решения, которое может быть использовано для классификатора с c классами, можно описать с точки зрения его истинных положительных частот. Этот набор частот определяет точку, а множество всех возможных правил принятия решений формирует облако точек, определяющее гиперповерхность. При таком определении VUS представляет собой вероятность того, что классификатор сможет правильно классифицировать все c примеров, если ему будет предоставлен набор, содержащий один случайно выбранный пример из каждого класса. Реализация классификатора, который знает, что его входной набор состоит из одного примера из каждого класса, может сначала вычислить оценку качества соответствия для каждой возможной комбинации примера и класса, а затем использовать венгерский алгоритм для максимизации суммы c выбранных оценок по всем c! возможным способам назначения каждому классу ровно одного примера. Учитывая успех кривых ROC в оценке моделей классификации, также было исследовано расширение кривых ROC для других задач обучения с учителем. Заметными предложениями для задач регрессии являются так называемые кривые характеристики ошибки регрессии (REC) и кривые регрессионной ROC (RROC). В последнем случае кривые RROC становятся чрезвычайно похожими на кривые ROC для классификации, с понятиями асимметрии, доминирования и выпуклой оболочки. Кроме того, площадь под кривыми RROC пропорциональна дисперсии ошибки регрессионной модели.