Введение
Понятия статистического гипотетического тестирования ошибочные результаты статистических тестов В статистическом тестировании гипотез ошибка I типа, или ложноположительное, является отвержением нулевой гипотезы, когда она на самом деле верна. Например, невиновный человек может быть осужден. Ошибка второго типа, или ложное отрицание, - это неспособность отклонить нулевую гипотезу, которая на самом деле является ложной. Например, виновный может не быть осужден. Большая часть статистической теории вращается вокруг минимизации одной или обеих этих ошибок, хотя полное устранение любой из них является статистической невозможностью, если результат не определяется известным, наблюдаемым причинным процессом. Выбрав низкое пороговое значение (отрезание) и изменив уровень альфа (α), можно повысить качество теста гипотезы. Знания об ошибках I и II типа широко используются в медицинской науке, биометрике и информатике. Интуитивно ошибки I типа можно рассматривать как ошибки комиссии (т.е. исследователь неудачно делает вывод, что что-то является фактом). Например, рассмотрим исследование, в котором исследователи сравнивают лекарство с плацебо. Если пациентам, получающим препарат, случайно получается лучше, чем пациентам, получающим плацебо, может показаться, что препарат эффективен, но на самом деле вывод неверен. Напротив, ошибки типа II - это ошибки упущения. В приведенном выше примере, если пациенты, получавшие препарат, не стали лучше с более высокой скоростью, чем те, кто получал плацебо, но это была случайность, это будет ошибка второго типа. Последствия ошибки типа II зависят от размера и направления пропущенного определения и обстоятельств. Дорогостоящее лечение для одного пациента из миллиона может быть несущественным, даже если это действительно лечение.
erroneous outcomes of statistical tests
In statistical hypothesis testing, a type I error, or a false positive, is the rejection of the null hypothesis when it is actually true. For example, an innocent person may be convicted. A type II error, or a false negative, is the failure to reject a null hypothesis that is actually false. For example: a guilty person may be not convicted. Much of statistical theory revolves around the minimization of one or both of these errors, though the complete elimination of either is a statistical impossibility if the outcome is not determined by a known, observable causal process. By selecting a low threshold (cut off) value and modifying the alpha (α) level, the quality of the hypothesis test can be increased. The knowledge of type I errors and type II errors is widely used in medical science, biometrics and computer science. Intuitively, type I errors can be thought of as errors of commission (i. e., the researcher unluckily concludes that something is the fact). For instance, consider a study where researchers compare a drug with a placebo. If the patients who are given the drug get better than the patients given the placebo by chance, it may appear that the drug is effective, but in fact the conclusion is incorrect. By contrast, type II errors are errors of omission. In the example above, if the patients who got the drug did not get better at a higher rate than the ones who got the placebo, but this was a random fluke, that would be a type II error. The consequence of a type II error depends on the size and direction of the missed determination and the circumstances. An expensive cure for one in a million patients may be inconsequential even if it truly is a cure.
Статистические данные
В теории статистических тестов понятие статистической ошибки является неотъемлемой частью тестирования гипотез. Тест заключается в выборе двух конкурирующих предложений, называемых нулевой гипотезой, обозначаемой H0, и альтернативной гипотезой, обозначаемой H1. Это концептуально похоже на решение в судебном процессе. Нулевая гипотеза соответствует позиции обвиняемого: так же, как он считается невиновным до тех пор, пока не будет доказана его вина, нулевая гипотеза считается истинной до тех пор, пока данные не предоставят убедительных доказательств против нее. Альтернативная гипотеза соответствует позиции против ответчика. В частности, нулевая гипотеза также включает отсутствие разницы или отсутствие ассоциации. Таким образом, нулевая гипотеза никогда не может быть, что есть разница или ассоциация. Если результат теста соответствует действительности, то принято правильное решение. Однако если результат испытания не соответствует действительности, то произошла ошибка. Есть две ситуации, в которых решение неверно. Нулевая гипотеза может быть верной, тогда как мы отвергаем H0. С другой стороны, альтернативная гипотеза H1 может быть верной, тогда как мы не отвергаем H0. Различают два типа ошибок: ошибка I типа и ошибка II типа.
Ошибка типа I
Первый тип ошибки - ошибочное отвержение нулевой гипотезы в результате процедуры тестирования. Этот тип ошибки называется ошибкой I типа (ложный положительный) и иногда называется ошибкой первого типа. В контексте примера с зала суда, ошибка I типа соответствует осуждению невиновного обвиняемого.
Коэффициент ошибки
Идеальный тест будет иметь нулевые ложные положительные и нулевые ложные отрицательные результаты. Однако статистические методы являются вероятностными, и нельзя с уверенностью сказать, правильны ли статистические выводы. Когда есть неопределенность, есть возможность совершить ошибку. Учитывая характер статистики, все статистические гипотезы могут допускать ошибки I и II типа. Коэффициент ошибки I типа - это вероятность отклонения нулевой гипотезы, учитывая, что она истинна. Испытание предназначено для поддержания частоты ошибок типа I ниже заранее определенной границы, называемой уровнем значимости, обычно обозначаемой греческой буквой α (альфа), также называемой уровнем альфа. Обычно уровень значимости устанавливается на 0,05 (5%), что означает, что допустимо иметь 5% вероятность неправильного отклонения истинной нулевой гипотезы. Скорость ошибки II типа обозначается греческой буквой β (бета) и связана с мощностью испытания, которая равна 1 - β. Эти два типа частоты ошибок взаимозаменяются: для любого данного набора выборки усилия по уменьшению одного типа ошибок обычно приводят к увеличению другого типа ошибок.
Качество проверки гипотезы
Эта же идея может быть выражена в терминах частоты правильных результатов и, следовательно, использоваться для минимизации частоты ошибок и улучшения качества проверки гипотезы. Чтобы снизить вероятность совершения ошибки I типа, сделать значение альфа более строгим довольно просто и эффективно. Для уменьшения вероятности ошибки II типа, которая тесно связана с мощностью анализа, увеличение размера выборки для испытания или снижение уровня альфа может увеличить мощность анализа. Статистика испытаний надежна, если уровень ошибок типа I контролируется. Для повышения специфичности или чувствительности испытания можно использовать различные пороговые значения (отсечение), что, в свою очередь, повышает качество испытания. Например, представьте себе медицинский тест, в котором исследователь может измерить концентрацию определенного белка в образце крови. Экспериментатор может скорректировать порог (черная вертикальная линия на рисунке), и людям будет поставлен диагноз заболевания, если любое число обнаружено выше этого определенного порога. Согласно изображению, изменение порога приведет к изменениям ложных положительных и ложных отрицательных результатов, соответствующих движению по кривой.
Пример
Поскольку в реальном эксперименте невозможно избежать всех ошибок типа I и типа II, важно рассмотреть, насколько рискованно принять ложный отказ от H0 или принятие H0. Решение этого вопроса заключается в сообщении о p-значении или уровне значимости α статистики. Например, если p-значение статистического результата теста оценивается в 0,0596, то вероятность того, что мы ложно отвергаем H0, составляет 5,96%. Или, если мы скажем, что статистика выполняется на уровне α, например, 0,05, то мы позволим ложно отвергнуть H0 на уровне 5%. Уровень значимости α 0,05 является относительно распространенным, но нет общего правила, которое бы соответствовало всем сценариям.
Измерение скорости транспортного средства
Предельная скорость на автострадах в Соединенных Штатах составляет 120 километров в час (75 миль в час). Устройство измеряет скорость проезжающих транспортных средств. Предположим, что устройство будет проводить три измерения скорости проезжающего транспортного средства, записывая как случайный образец X1, X2, X3. Дорожная полиция будет или не будет штрафовать водителей в зависимости от средней скорости, то есть, от статистики испытаний Кроме того, мы предполагаем, что измерения X1, X2, X3 моделируются как нормальное распределение N{\displaystyle N} ,{\displaystyle N} . Затем T следует за N(μ,2/) и параметр μ представляет собой истинную скорость проезжающего транспортного средства. В этом эксперименте нулевая гипотеза H0 и альтернативная гипотеза H1 должны быть H0: μ=120 против H1: μ>120. Если мы выполним статистический уровень при α=0,05, то необходимо вычислить критическое значение c для решения по правилу изменения единиц для нормального распределения. Ссылаясь на Z таблицы, мы можем получить здесь, критическая область. То есть, если зарегистрированная скорость транспортного средства превышает критическое значение 121,9, водитель будет оштрафован. Однако, есть еще 5% водителей, которые были ошибочно оштрафованы, так как средняя зарегистрированная скорость была больше 121,9 а реальная скорость не превышала 120, что мы называем ошибкой I типа. Ошибка типа II соответствует случаю, когда реальная скорость транспортного средства превышает 120 километров в час, но водитель не штрафован. Например, если истинная скорость транспортного средства μ=125, вероятность того, что водитель не будет оштрафован, может быть рассчитана как означающая, что если истинная скорость транспортного средства равна 125, то у водителя есть вероятность 0,36% избежать штрафа, когда статистика выполняется на уровне α=0,05, поскольку средняя зарегистрированная скорость ниже 121,9. Если истинная скорость ближе к 121,9 чем к 125, то вероятность избежать штрафа также будет выше. Также следует учитывать компромиссы между ошибками типа I и типа II. То есть, в этом случае, если полиция дорожного движения не хочет ложно штрафовать невинных водителей, уровень α может быть установлен на меньшее значение, например 0,01. Однако, если это так, то больше водителей, чья реальная скорость превышает 120 километров в час, например 125, скорее всего, избегут штрафа.
In addition, we suppose that the measurements X1, X2, X3 are modeled as normal distribution N(μ,2). Then, T should follow N(μ,2/) and the parameter μ represents the true speed of passing vehicle. In this experiment, the null hypothesis H0 and the alternative hypothesis H1 should be
H0: μ=120 against H1: μ>120. If we perform the statistic level at α=0.05, then a critical value c should be calculated to solve
According to change of units rule for the normal distribution. Referring to Z table, we can get
Here, the critical region. That is to say, if the recorded speed of a vehicle is greater than critical value 121.9, the driver will be fined. However, there are still 5% of the drivers are falsely fined since the recorded average speed is greater than 121.9 but the true speed does not pass 120, which we say, a type I error. The type II error corresponds to the case that the true speed of a vehicle is over 120 kilometers per hour but the driver is not fined. For example, if the true speed of a vehicle μ=125, the probability that the driver is not fined can be calculated as
which means, if the true speed of a vehicle is 125, the driver has the probability of 0.36% to avoid the fine when the statistic is performed at level α=0.05, since the recorded average speed is lower than 121.9. If the true speed is closer to 121.9 than 125, then the probability of avoiding the fine will also be higher. The tradeoffs between type I error and type II error should also be considered. That is, in this case, if the traffic police do not want to falsely fine innocent drivers, the level α can be set to a smaller value, like 0.01. However, if that is the case, more drivers whose true speed is over 120 kilometers per hour, like 125, would be more likely to avoid the fine.
Нулевая гипотеза
Стандартной практикой для статистиков является проведение тестов для определения того, может ли быть поддержана "спекулятивная гипотеза" относительно наблюдаемого явления мира (или его жителей). Результаты таких испытаний определяют, согласуется ли определенный набор результатов в разумной степени (или не согласуется) с предполагаемой гипотезой. На основании того, что по статистическим соображениям всегда предполагается, что предполагаемая гипотеза неверна, а так называемая "нулевая гипотеза" заключается в том, что наблюдаемые явления просто происходят случайно (и что, как следствие, предполагаемый агент не оказывает никакого эффекта) тест определит, правильна ли эта гипотеза или нет. Именно поэтому проверяемую гипотезу часто называют нулевой гипотезой (скорее всего, придуманной Фишером (1935, с. 19), потому что именно эта гипотеза должна быть либо аннулирована, либо не аннулирована тестом. Когда нулевая гипотеза аннулируется, можно сделать вывод, что данные поддерживают "альтернативную гипотезу" (которая является первоначальной предполагаемой). Последовательное применение статистиками конвенции Неймана и Пирсона о представлении "гипотезы, подлежащей проверке" (или "гипотезы, подлежащей аннулированию") с выражением H0 привело к обстоятельствам, при которых многие понимают термин "нулевая гипотеза" как означающий "ничтожная гипотеза" заявление о том, что рассматриваемые результаты возникли случайно. Это не обязательно так. Основное ограничение, согласно Фишеру (1966), заключается в том, что "нулевая гипотеза должна быть точной, то есть свободной от неясности и двусмысленности, потому что она должна обеспечивать основу "проблемы распределения", решением которой является тест значимости". В результате этого в экспериментальной науке нулевая гипотеза обычно является утверждением, что конкретное лечение не имеет никакого эффекта; в науке наблюдений, это означает, что нет никакой разницы между значением конкретной измеренной переменной и экспериментальным прогнозом.
Медицина
В практике медицины существенны различия между применением скрининга и тестирования.
Медицинский скрининг
Скрининг включает в себя относительно дешевые тесты, которые проводятся большим количеством людей, ни у кого из которых нет клинических признаков заболевания (например, мазки Пап). Исследования включают в себя гораздо более дорогие, часто инвазивные процедуры, которые проводятся только для тех, кто проявляет некоторые клинические признаки заболевания, и чаще всего применяются для подтверждения предполагаемого диагноза. Например, большинство штатов в США требуют, чтобы новорожденных обследовали на фенокетонурию и гипотиреоз, а также другие врожденные заболевания. Гипотеза: "У новорожденных фенокетонурия и гипотиреоз". Нулевая гипотеза (H0): "У новорожденных нет фенокетонурии и гипотиреоза". Ошибка I типа (ложноположительный результат): Правда заключается в том, что у новорожденных нет фенокетонурии и гипотиреоза, но мы считаем, что у них есть нарушения, согласно данным. Ошибка типа II (ложноотрицательный результат): Правда, у новорожденных фенокетонурия и гипотиреоз, но мы считаем, что у них нет этих нарушений, согласно данным. Хотя в них часто обнаруживается ложноположительный результат, скрининговые тесты считаются ценными, поскольку они значительно увеличивают вероятность обнаружения этих нарушений на более ранней стадии. Простые анализы крови, используемые для выявления ВИЧ и гепатита у потенциальных доноров крови, часто дают ложноположительные результаты; однако врачи используют гораздо более дорогие и более точные анализы, чтобы определить, действительно ли человек заражен одним из этих вирусов. Возможно, самые широко обсуждаемые ложные положительные результаты в медицинском скрининге происходят из процедуры скрининга рака молочной железы - маммографии. В США число ложноположительных маммограмм составляет до 15%, что является самым высоким показателем в мире. Одним из последствий высокого числа ложных результатов в США является то, что за любой 10-летний период половина американских женщин, прошедших скрининг, получают ложноположительную маммографию. Ложноположительные маммограммы стоят дорого, и в США ежегодно на последующие исследования и лечение тратится более 100 миллионов долларов. Они также вызывают женщинам ненужную тревогу. В результате высокого уровня ложных положительных результатов в США, 90-95% женщин, получивших положительную маммографию, не имеют этого заболевания. Самый низкий процент в мире - в Нидерландах, 1%. Наиболее низкие показатели, как правило, отмечаются в Северной Европе, где маммографические пленки прочитываются дважды и устанавливается высокий порог для дополнительного тестирования (высокий порог снижает эффективность теста). Идеальный скринингный тест для населения будет дешевым, простым в применении и, если это возможно, не будет давать ложных отрицательных результатов. Такие тесты обычно дают больше ложных положительных результатов, которые впоследствии могут быть сортированы более сложными (и дорогими) тестами.
Медицинское обследование
Ложные отрицательные и ложные положительные результаты являются важными проблемами в медицинском тестировании. Гипотеза: "Пациенты имеют конкретную болезнь". Нулевая гипотеза (H0): "Пациенты не имеют конкретного заболевания". Ошибка I типа (ложноположительный результат): Правда заключается в том, что у пациентов нет конкретного заболевания, но врач судит, что пациент болен в соответствии с отчетами об испытаниях. Ошибка II типа (ложноотрицательный результат): Правда заключается в том, что болезнь действительно присутствует, но результаты исследований дают пациентам и врачам ложное убеждение в отсутствии болезни. Ложные положительные результаты также могут создавать серьезные и противоположные интуитивным проблемам, когда состояние, которое ищут, редко, как при скрининге. Если тест имеет ложноположительный коэффициент один из десяти тысяч, но только один из миллиона образцов (или людей) является истинно положительным, большинство положительных результатов, обнаруженных этим тестом, будут ложными. Вероятность того, что наблюдаемый положительный результат является ложным положительным, может быть рассчитана с использованием теоремы Бейса. Ложные отрицательные результаты создают серьезные и противоречащие интуиции проблемы, особенно когда состояние, которое ищут, является распространенным. Если для тестирования популяции с истинной частотой возникновения 70%, используется тест с ложноотрицательным показателем только 10%, многие отрицательные результаты, обнаруженные тестом, будут ложными. Это иногда приводит к неправильному или неадекватному лечению как пациента, так и его болезни. Распространенным примером является использование стресс-тестов для выявления коронарной атеросклерозы, хотя известно, что стресс-тесты для выявления коронарной артерии могут выявлять только ограничения кровотока из-за продвинутого стеноза.
Биометрические данные
Биометрическое совпадение, например, для распознавания отпечатков пальцев, распознавания лиц или распознавания радужной оболочки глаза, подвержено ошибкам типа I и типа II. Гипотеза: "Ввод не идентифицирует кого-то в списке людей, которые были исканы". Нулевая гипотеза: "Ввод действительно идентифицирует кого-то в списке людей, которые были исканы". Ошибка I типа (ложный процент отказов): истинный факт заключается в том, что человек находится в списке, но система делает вывод, что человек не соответствует данным. Ошибка типа II (показатель ложных совпадений): Правда заключается в том, что человек не является кем-то из списка, но система делает вывод, что человек является тем, кого мы ищем в соответствии с данными. Вероятность ошибок типа I называется "показателем ложного отклонения" (FRR) или "показателем ложного несоответствия" (FNMR), в то время как вероятность ошибок типа II называется "показателем ложного принятия" (FAR) или "показателем ложного совпадения" (FMR). Если система разработана так, чтобы подозреваемые редко совпадали, то вероятность ошибок типа II можно назвать "показателем ложной тревоги". С другой стороны, если система используется для валидации (и принятие является нормой), то FAR является мерой безопасности системы, в то время как FRR измеряет уровень неудобств пользователя.
Проверка безопасности
Ложные результаты выявляются каждый день при проверке безопасности в аэропортах, которые в конечном счете являются системами визуального контроля. Установленные сигнализации предназначены для того, чтобы не допустить попадания оружия в самолет, но часто они настолько чувствительны, что по нескольку раз в день сигнализируют о появлении мелочей, таких как ключи, петли ремней, мелочи, мобильные телефоны и клюшки в обуви. Гипотеза: "Этот предмет - оружие". Нулевая гипотеза: "Этот предмет не является оружием". Ошибка I типа (ложноположительный): Правда в том, что предмет не является оружием, но система все равно подает сигнал тревоги. Ошибка типа II (ложноотрицательный) Правда в том, что предмет является оружием, но система в данный момент молчит. Соотношение ложных положительных результатов (идентификация невинного путешественника как террориста) к истинным положительным результатам (открытие террориста) очень высоко; и поскольку почти каждая тревога является ложноположительной, положительное прогнозирующее значение этих скрининговых тестов очень низкое. Относительная стоимость ложных результатов определяет вероятность того, что создатели теста позволяют этим событиям произойти. Поскольку стоимость ложного отрицательного в этом сценарии чрезвычайно высока (не обнаружение бомбы, доставленной на самолет, может привести к сотням смертей), в то время как стоимость ложного положительного относительно низка (разумно простая дополнительная проверка), наиболее подходящим тестом является тест с низкой статистической специфичностью, но высокой статистической чувствительностью (тест, который позволяет получить высокий уровень ложных положительных результатов в обмен на минимальные ложные отрицательные результаты).