Введение
Неправильное использование анализа данных
Дренаж данных (также известный как "охота за данными" или "p-хакинг") — это некорректное использование анализа данных для выявления закономерностей, которые могут быть представлены как статистически значимые, что существенно увеличивает риск ложноположительных результатов и недооценивает его. Это достигается путем проведения множества статистических тестов на данных и сообщения только о тех, которые показали значимые результаты. Дренаж данных является примером игнорирования проблемы множественных сравнений. Один из видов этого явления — сравнение подгрупп без уведомления читателя об общем количестве выполненных сравнений подгрупп.
Вывод из данных
Обычная процедура статистического тестирования гипотез, основанная на частотной вероятности, заключается в формулировании исследовательской гипотезы, например, "люди из более высоких социальных слоев живут дольше", а затем в сборе соответствующих данных. В заключение проводится тест на статистическую значимость, чтобы оценить вероятность получения таких результатов исключительно за счет случайности (также известное как проверка против нулевой гипотезы). Ключевым моментом в корректном статистическом анализе является проверка гипотезы с использованием данных, которые не использовались при её формулировании. Это критически важно, поскольку любой набор данных содержит определенные закономерности, возникающие исключительно из-за случайных факторов. Если гипотеза не проверяется на другом наборе данных из той же статистической генеральной совокупности, невозможно оценить вероятность того, что подобные закономерности возникли бы только случайно. Например, если при пяти бросках монеты выпало 2 орла и 3 решки, можно выдвинуть гипотезу о том, что монета смещена в сторону решки в соотношении 3/5 к 2/5. Если затем эта гипотеза проверяется на том же наборе данных, она подтверждается, но это подтверждение не имеет смысла. Правильным подходом было бы заранее сформулировать гипотезу о вероятности выпадения решки, а затем многократно бросить монету, чтобы проверить, отвергается ли эта гипотеза. Если в результате выпало три решки и две орла, можно сформулировать другую гипотезу о том, что вероятность выпадения решки равна 3/5, но её можно проверить только с помощью нового набора бросков монеты. Важно понимать, что статистическая значимость, полученная при использовании некорректной процедуры, является полностью фиктивной – тесты на значимость не защищают от "рытья в данных".
Гипотеза, предложенная непредставительными данными
Предположим, что исследование случайной выборки людей включает ровно двух человек, у которых день рождения 7 августа: Мария и Джон. Человек, занимающийся "копанием в данных" (data dredging), может попытаться найти дополнительные сходства между Марией и Джоном. Просматривая сотни или тысячи потенциальных сходств между ними, каждое из которых имеет низкую вероятность быть истинным, почти наверняка можно обнаружить необычное совпадение. Например, Джон и Мария могут быть единственными в исследовании, кто трижды менял специализацию в университете. Гипотеза, искажённая "копанием в данных", может быть сформулирована так: "люди, родившиеся 7 августа, гораздо чаще меняют специализацию в университете более двух раз". Сами по себе данные, вырванные из контекста, могут показаться убедительным подтверждением этой корреляции, поскольку никто с другим днем рождения не менял специализацию трижды. Однако, если (что весьма вероятно) это ложная гипотеза, этот результат, скорее всего, не удастся воспроизвести; любая попытка проверить, имеют ли другие люди, родившиеся 7 августа, аналогичный уровень смены специализаций, скорее всего, почти сразу же даст противоречивые результаты.
Систематический уклон
Склонность — это систематическая ошибка в анализе. Например, врачи направляли ВИЧ-инфицированных пациентов с высоким риском сердечно-сосудистых заболеваний на лечение абакавиром, а пациентов с низким риском — на другие препараты, что затрудняло объективное сравнение абакавира с другими методами лечения. Анализ, не учитывающий эту склонность, несправедливо ставил абакавир в невыгодное положение, поскольку его пациенты изначально были более подвержены риску, и, следовательно, у большей их части случались сердечные приступы. Отсутствующие данные, неучтенные вмешивающиеся факторы и потеря пациентов из виду также могут приводить к появлению склонности.
В метеорологии и эпидемиологии
В метеорологии гипотезы часто формулируются на основе данных о погоде, накопленных к настоящему моменту, и проверяются с использованием будущих данных о погоде, что обеспечивает исключение даже подсознательного влияния будущих данных на формулировку гипотезы. Разумеется, такая методология требует ожидания поступления новых данных для оценки прогностической силы сформулированной теории в сравнении с нулевой гипотезой. Этот процесс гарантирует, что исследователя нельзя будет обвинить в подгонке прогностической модели под имеющиеся данные, поскольку будущая погода еще неизвестна. В качестве другого примера, предположим, что наблюдатели отмечают наличие очага заболеваемости раком в определенном городе, но не имеют четкой гипотезы о причинах этого. Однако у них есть доступ к обширным демографическим данным о городе и прилегающей территории, включающим измерения сотен или тысяч различных переменных, в основном некоррелированных между собой. Даже если все эти переменные не связаны с заболеваемостью раком, весьма вероятно, что хотя бы одна из них будет существенно коррелировать с уровнем заболеваемости в данном районе. Хотя это может навести на гипотезу, для ее подтверждения необходимо дальнейшее тестирование с использованием тех же переменных, но с данными из другого региона. Следует отметить, что p-значение 0,01 указывает на то, что в 1% случаев случайным образом может быть получен результат, по крайней мере, столь же экстремальный; если тестируются сотни или тысячи гипотез (с относительно некоррелированными независимыми переменными), то вероятность получения p-значения меньше 0,01 для многих нулевых гипотез достаточно высока.
В социологии
Другой способ сгладить p-кривую — это контролировать пол. Анализ, проведенный Simonsohn и др., исследования Брунса и Иоаннидиса (2016) это демонстрирует: когда Брунс и Иоаннидис исключили контроль по полу, это также привело к снижению сообщаемого t-значения с 9,29 до 0,88, показав не причинно-следственную связь там, где ранее была зафиксирована причинная связь (3). Это важное открытие, поскольку t-значения обратно пропорциональны p-значениям, то есть более высокие t-значения (выше 2,8) указывают на более низкие p-значения. Контролируя пол, можно искусственно завысить t-значение, тем самым искусственно занизив p-значение.
Появление в СМИ
Одним из примеров является фальсифицированное исследование о похудении с помощью шоколада, проведенное журналистом Джоном Боханноном, который публично объяснил в статье для Gizmodo, что исследование было намеренно проведено с нарушениями в качестве социального эксперимента. Это исследование широко распространилось в СМИ около 2015 года, и многие люди, несмотря на здравый смысл, поверили утверждению о том, что употребление шоколадного батончика каждый день способствует потере веса. Исследование было опубликовано в Институте диеты и здоровья. По словам Боханнона, для снижения p-значения ниже 0,05 было критически важно учитывать 18 различных переменных при проведении тестирования.
Лечебные средства
Хотя поиск закономерностей в данных является допустимой практикой, применение статистического теста значимости или проверки гипотез к тем же данным до тех пор, пока не обнаружится закономерность, чревато злоупотреблениями. Один из способов формулирования гипотез, позволяющий избежать "рытья в данных", – проведение рандомизированных вневыборочных тестов. Исследователь собирает набор данных, затем случайным образом разделяет его на два подмножества, А и В. Для формулирования гипотез исследуется только одно подмножество – например, подмножество А. После формулировки гипотезы она должна быть проверена на подмножестве В, которое не использовалось для ее построения. Только если подмножество В также подтверждает эту гипотезу, можно обоснованно полагать, что она может быть верной. (Это простой тип перекрестной проверки, часто называемый "обучающим тестом" или "валидацией по половинному разбиению"). Другой способ борьбы с "рытьем в данных" – зафиксировать количество всех тестов значимости, проведенных в ходе исследования, и просто разделить критерий значимости (альфа) на это число; это поправка Бонферрони. Однако это очень консервативная мера. Общий уровень значимости альфа, равный 0,05, разделенный таким образом на 1000 для учета 1000 тестов значимости, дает очень строгий уровень значимости для каждой гипотезы – 0,00005. Методы, особенно полезные при анализе дисперсии и построении одновременных доверительных интервалов для регрессий, включающих базисные функции, – это метод Шеффе и, если исследователь планирует только попарные сравнения, метод Тьюки. Чтобы избежать чрезмерной консервативности поправки Бонферрони, доступны более сложные методы селективного вывода. Наиболее распространенным методом селективного вывода является использование процедуры контроля частоты ложных открытий Бенджамини и Хохберга: это менее консервативный подход, который стал популярным методом контроля множественных проверок гипотез. Если ни один из подходов не является практичным, следует четко разграничивать анализ данных, который является подтверждающим, и анализ, который является разведочным. Статистический вывод уместен только для первого типа анализа. European Journal of Personality определяет этот формат следующим образом: "В зарегистрированном отчете авторы представляют предложение исследования, включающее теоретическую и эмпирическую базу, исследовательские вопросы/гипотезы и пилотные данные (если таковые имеются). После подачи это предложение рассматривается до сбора данных, и если оно принято, статья, полученная в результате этой процедуры рецензирования, будет опубликована независимо от результатов исследования". Методы и результаты также могут быть опубликованы в открытом доступе, как это делается в рамках подхода открытой науки, что еще больше затрудняет "рытье в данных".