Введение
При наличии популяции, члены которой каждый принадлежат к одному из нескольких различных множеств или классов, правило классификации или классификатор — это процедура, с помощью которой каждому элементу популяции предсказывается принадлежность к одному из классов. Идеальная классификация — это такая классификация, при которой каждый элемент популяции отнесен к классу, которому он действительно принадлежит. Классификатор Байеса — это классификатор, оптимально присваивающий классы на основе известных атрибутов (то есть признаков или регрессоров) элементов, подлежащих классификации. Особый вид правила классификации — бинарная классификация, для задач, в которых существует только два класса.
Правила классификации испытаний
Имея набор данных, состоящий из пар x и y, где x обозначает элемент популяции, а y – класс, к которому он принадлежит, правило классификации h(x) является функцией, которая присваивает каждому элементу x предсказанный класс. Бинарная классификация предполагает, что метка y может принимать только одно из двух значений. Истинные метки yi могут быть известны, но не обязательно будут совпадать с их приближениями. В бинарной классификации элементы, которые классифицированы неверно, называются ложноположительными и ложноотрицательными. Некоторые правила классификации являются статическими функциями, другие – компьютерными программами. Компьютерный классификатор может обучаться или реализовывать статические правила классификации. Для обучающего набора данных истинные метки yj неизвестны, однако основной целью процедуры классификации является получение максимально точного приближения, при этом качество этого приближения необходимо оценивать на основе статистических или вероятностных свойств генеральной совокупности, из которой будут получены будущие наблюдения. При заданном правиле классификации, классификационный тест – это результат применения этого правила к конечной выборке из исходного набора данных.
Бинарная и многоклассная классификация
Классификацию можно рассматривать как две отдельные задачи – бинарная классификация и многоклассовая классификация. В бинарной классификации, которая является более изученной задачей, вовлечены только два класса, в то время как многоклассовая классификация предполагает отнесение объекта к одному из нескольких классов. Поскольку многие методы классификации были разработаны специально для бинарной классификации, многоклассовая классификация часто требует комбинированного использования нескольких бинарных классификаторов. Важно отметить, что во многих практических задачах бинарной классификации две группы не симметричны – важнее относительное соотношение различных типов ошибок, чем общая точность. Например, в медицинском тестировании ложноположительный результат (обнаружение болезни, которой нет) оценивается иначе, чем ложноотрицательный результат (необнаружение болезни, которая есть). В многоклассовой классификации классы могут рассматриваться симметрично (все ошибки равнозначны) или асимметрично, что значительно усложняет задачу. Методы бинарной классификации включают пробит-регрессию и логистическую регрессию. Методы многоклассовой классификации включают многочленный пробит и многочленный логит.
Ложноположительные результаты
Ложноположительные результаты возникают, когда тест ошибочно (неверно) выдает положительный результат. Например, медицинский тест на наличие заболевания может показать положительный результат, указывающий на то, что у пациента есть это заболевание, даже если на самом деле это не так. Ложноположительный результат обычно обозначается как ячейка в верхнем правом углу (отрицательное состояние X положительный результат теста) в матрице ошибок.
Ложные отрицательные
С другой стороны, ложноотрицательные результаты возникают, когда тест ошибочно или некорректно выдает отрицательный результат. Например, медицинский тест на наличие заболевания может показать отрицательный результат, указывая на отсутствие болезни у пациента, хотя на самом деле болезнь присутствует. Ложноотрицательный результат обычно обозначается как нижний левый элемент (наличие состояния – отрицательный результат теста) в матрице ошибок.
Истинно положительные
Истинные положительные результаты возникают, когда тест верно определяет положительный результат. Например, медицинский тест на наличие заболевания может показать положительный результат, указывающий на то, что у пациента это заболевание есть. Это подтверждается, когда последующее обследование пациента подтверждает наличие заболевания. Истинные положительные обычно обозначаются как верхняя левая ячейка (наличие состояния – положительный результат теста) в матрице ошибок.
Истинные негативы
Верный отрицательный результат – это когда тест правильно показывает отрицательный результат. Например, медицинский тест на наличие заболевания может выдать отрицательный результат, подтверждающий, что у пациента нет этого заболевания. Это считается верным, когда дальнейшие исследования также показывают отсутствие заболевания у пациента. Истинно отрицательный результат обычно обозначается как нижний правый элемент (отрицательное состояние X отрицательный результат теста) в матрице ошибок.
Ложноположительные результаты
Мы можем использовать теорему Байеса, чтобы определить вероятность того, что положительный результат является ложноположительным. Мы обнаруживаем, что если заболевание редкое, то большинство положительных результатов могут быть ложноположительными, даже если тест относительно точен. Наивно можно подумать, что только 5% положительных результатов теста являются ложными, но это совершенно неверно, как мы увидим. Предположим, что только 0,1% населения страдает этим заболеванием, так что случайно выбранный пациент имеет априорную вероятность 0,001 заболеть этим заболеванием. Мы можем использовать теорему Байеса, чтобы рассчитать вероятность того, что положительный результат теста является ложноположительным, и, следовательно, вероятность того, что положительный результат является ложным положительным, составляет примерно 1 – 0,019 = 0,98, или 98%. Несмотря на кажущуюся высокую точность теста, заболеваемость настолько низка, что подавляющее большинство пациентов с положительным результатом не имеют этого заболевания. Тем не менее, доля пациентов, у которых положительный результат теста указывает на наличие заболевания (0,019), в 19 раз превышает долю людей, которые еще не проходили тестирование, но имеют это заболевание (0,001). Таким образом, тест не бесполезен, и повторное тестирование может повысить достоверность результата. Чтобы уменьшить проблему ложноположительных результатов, тест должен быть очень точным в определении отрицательного результата, когда у пациента нет заболевания. Если тест показывает отрицательный результат у пациентов без заболевания с вероятностью 0,999, то вероятность ложноположительного результата составит 1 – 0,5 = 0,5.
so that 1 − 0.5 = 0.5 now is the probability of a false positive.
Истинные негативы
Мы также можем использовать теорему Байеса для вычисления вероятности истинно отрицательного результата. Используя приведенные выше примеры:
Если у обследованного пациента есть заболевание, тест показывает положительный результат в 99% случаев, то есть с вероятностью 0,99. Вероятность того, что отрицательный результат является истинно отрицательным, составляет 0,9999494 или 99,99%. Поскольку заболевание встречается редко, а доля истинно положительных результатов высока, и доля истинно отрицательных результатов также высока, это приведет к высокой частоте истинно отрицательных результатов.
Измерение классификатора с чувствительностью и специфичностью
При обучении классификатора можно измерить его производительность, используя общепринятые метрики чувствительности и специфичности. Может быть полезно сравнить классификатор со случайным классификатором, который принимает решение случайным образом, основываясь на распространенности заболевания. Предположим, что вероятность того, что у человека есть заболевание, равна , а вероятность того, что заболевания нет, равна . Предположим далее, что у нас есть случайный классификатор, который предполагает наличие заболевания у пациента с той же вероятностью , и отсутствие заболевания – с той же вероятностью .
The probability of a true positive is the probability that the patient has the disease times the probability that the random classifier guesses this correctly, or With similar reasoning, the probability of a false negative is From the definitions above, the sensitivity of this classifier is With similar reasoning, we can calculate the specificity as
So, while the measure itself is independent of disease prevalence, the performance of this random classifier depends on disease prevalence. The classifier may have performance that is like this random classifier, but with a better weighted coin (higher sensitivity and specificity). So, these measures may be influenced by disease prevalence. An alternative measure of performance is the Matthews correlation coefficient, for which any random classifier will get an average score of 0. The extension of this concept to non binary classifications yields the confusion matrix.
Вероятность истинноположительного результата – это вероятность наличия заболевания у пациента, умноженная на вероятность того, что случайный классификатор правильно это определит, то есть . Аналогичным образом, вероятность ложноотрицательного результата равна . Исходя из этих определений, чувствительность этого классификатора равна . Аналогично можно рассчитать специфичность как .
The probability of a true positive is the probability that the patient has the disease times the probability that the random classifier guesses this correctly, or With similar reasoning, the probability of a false negative is From the definitions above, the sensitivity of this classifier is With similar reasoning, we can calculate the specificity as
So, while the measure itself is independent of disease prevalence, the performance of this random classifier depends on disease prevalence. The classifier may have performance that is like this random classifier, but with a better weighted coin (higher sensitivity and specificity). So, these measures may be influenced by disease prevalence. An alternative measure of performance is the Matthews correlation coefficient, for which any random classifier will get an average score of 0. The extension of this concept to non binary classifications yields the confusion matrix.
Таким образом, хотя сама метрика не зависит от распространенности заболевания, производительность этого случайного классификатора зависит от нее. Классификатор может демонстрировать производительность, подобную этому случайному классификатору, но с более «взвешенной монетой» (более высокой чувствительностью и специфичностью). Следовательно, на эти метрики может влиять распространенность заболевания. Альтернативной мерой производительности является коэффициент корреляции Мэтьюса, для которого любой случайный классификатор получит средний балл 0. Обобщение этой концепции на многоклассовую классификацию приводит к матрице ошибок.
The probability of a true positive is the probability that the patient has the disease times the probability that the random classifier guesses this correctly, or With similar reasoning, the probability of a false negative is From the definitions above, the sensitivity of this classifier is With similar reasoning, we can calculate the specificity as
So, while the measure itself is independent of disease prevalence, the performance of this random classifier depends on disease prevalence. The classifier may have performance that is like this random classifier, but with a better weighted coin (higher sensitivity and specificity). So, these measures may be influenced by disease prevalence. An alternative measure of performance is the Matthews correlation coefficient, for which any random classifier will get an average score of 0. The extension of this concept to non binary classifications yields the confusion matrix.