Введение

Использование статистических аргументов для утверждения ложных сведений

Статистика, при недобросовестном использовании, может ввести в заблуждение неподготовленного наблюдателя, заставив его поверить во что-то отличное от того, что демонстрируют данные. Иными словами, злоупотребление статистикой происходит, когда статистический аргумент утверждает ложь. В некоторых случаях злоупотребление может быть случайным, в других – преднамеренным и направленным на извлечение выгоды. Если статистическое обоснование ложно или применено некорректно, это является статистической ошибкой (софизмом). Последствия подобных неверных интерпретаций могут быть крайне серьезными. Например, в медицине исправление ошибочного утверждения может занять десятилетия и стоить человеческих жизней. Злоупотребления статистикой случаются легко. Даже профессиональные ученые, математики и статистики могут быть обмануты даже простыми методами, несмотря на тщательную проверку. Ученые порой сами себя обманывают, используя статистику из-за недостаточных знаний теории вероятностей и отсутствия стандартизации в проведении исследований.

Отмена неблагоприятных замечаний

Чтобы продвигать нейтральный (бесполезный) продукт, компании необходимо найти или провести, например, 40 исследований с уровнем достоверности 95%. Если продукт бесполезен, то из этих исследований одно покажет пользу продукта, одно – вред, а тридцать восемь будут давать неубедительные результаты (38 – это 95% от 40). Эта тактика становится более эффективной при большем количестве доступных исследований. Организации, которые не публикуют все проведенные ими исследования, такие как табачные компании, отрицающие связь между курением и раком, организации, выступающие против курения, и средства массовой информации, пытающиеся доказать связь курения с различными заболеваниями, или продавцы "чудодейственных" препаратов, вероятно, будут использовать эту тактику. Рональд Фишер рассматривал этот вопрос в своем знаменитом эксперименте с дегустацией чая (из его книги 1935 года «Планирование экспериментов»). Говоря о повторных экспериментах, он отметил: «Было бы некорректно и подорвало бы основу наших расчетов, если бы неуспешные результаты не учитывались все». Другой термин, связанный с этим понятием, – «подбор данных».

Не обращая внимания на важные особенности

Многомерные наборы данных имеют два или более признака/измерения. Если для анализа выбрано недостаточное количество этих признаков (например, если выбран только один признак и вместо множественной линейной регрессии выполняется простая линейная регрессия), результаты могут быть обманчивыми. Это делает аналитика уязвимым к различным статистическим парадоксам или, в некоторых (но не во всех) случаях, к ложной причинно-следственной связи, как показано ниже.

Слишком большое обобщение

Сверхгенерализация – это логическая ошибка, возникающая, когда статистические данные о конкретной популяции распространяются на членов группы, для которой исходная популяция не является репрезентативной выборкой. Например, предположим, что летом наблюдается, что 100% яблок красные. Утверждение "Все яблоки красные" будет являться примером сверхгенерализации, поскольку исходная статистика была верна только для определенного подмножества яблок (летних), которое не может считаться репрезентативным для всей популяции яблок. Реальный пример этой ошибки можно увидеть в современных методах проведения опросов, которые ограничивают обзвон только стационарными телефонами при политических опросах. Поскольку молодые люди реже, чем другие демографические группы, пользуются стационарными телефонами, опрос, в котором участвуют только отвечающие на звонки с фиксированных телефонов, может недопредставлять мнение молодежи, если не предпринимаются другие меры для компенсации этого искажения выборки. Таким образом, опрос, изучающий предпочтения молодежи при голосовании с использованием этой методики, может не являться полностью точным отражением истинных предпочтений молодежи в целом без сверхгенерализации, поскольку выборка исключает молодых людей, пользующихся только мобильными телефонами, чьи предпочтения при голосовании могут отличаться от предпочтений остальной части населения. Сверхгенерализация часто встречается, когда информация распространяется через неспециализированные источники, особенно через средства массовой информации.

Указанные образцы

Ученые дорогой ценой убедились, что сбор качественных экспериментальных данных для статистического анализа – задача не из легких. Пример: эффект плацебо (сила внушения) чрезвычайно силен. У 100% испытуемых появилась сыпь при контакте с инертным веществом, ошибочно названным ядовитым плющом, в то время как сыпь у немногих возникла при контакте с настоящим ядовитым плющом, представленным как "безобидный" объект. Исследователи противодействуют этому эффекту, используя двойные слепые рандомизированные сравнительные эксперименты. Статистики, как правило, больше обеспокоены валидностью данных, чем самим анализом. Это отражено в области статистики, известной как планирование экспериментов. Специалисты по опросам также на собственном опыте узнали, что сбор качественных данных для статистического анализа – сложная задача. Селективное влияние сотовых телефонов на сбор данных (обсуждается в разделе "Обобщение") – один из возможных примеров; если молодежь, пользующаяся стационарными телефонами, не является репрезентативной, выборка может быть смещенной. Выборочные опросы сопряжены с множеством трудностей и требуют большой аккуратности при проведении. Одна из попыток потребовала почти 3000 телефонных звонков, чтобы получить 1000 ответов. Простая случайная выборка населения "не так проста, как кажется, и может оказаться не случайной".

Неправильная отчетность или неправильное понимание предполагаемой ошибки

Если исследовательская группа хочет узнать, что думают 300 миллионов человек по определенному вопросу, опрашивать их всех было бы непрактично. Однако, если группа выберет случайную выборку примерно из 1000 человек, она может быть достаточно уверена, что результаты, полученные от этой группы, репрезентативны для того, что сказала бы большая группа, если бы всех опросили. Эта уверенность может быть количественно оценена центральной предельной теоремой и другими математическими результатами. Уровень доверия выражается как вероятность того, что истинный результат (для большей группы) находится в пределах определенного диапазона оценки (значение для меньшей группы). Это значение "плюс-минус", которое часто указывается для статистических опросов. Вероятностная часть уровня доверия обычно не упоминается; если это не сделано, то предполагается стандартное значение, например, 95%. Эти два показателя взаимосвязаны. Если оценка погрешности опроса составляет ±5% при уровне доверия 95%, то она также составляет ±6,6% при уровне доверия 99%. Значение ±% при 95% доверии всегда соответствует ±% при 99% доверии для нормально распределенной совокупности. Чем меньше предполагаемая погрешность, тем больше необходимый размер выборки при заданном уровне доверия; например, при 95,4% доверии: ±1% потребует 10 000 человек. ±2% потребует 2500 человек. ±3% потребует 1111 человек. ±4% потребует 625 человек. ±5% потребует 400 человек. ±10% потребует 100 человек. ±20% потребует 25 человек. ±25% потребует 16 человек. ±50% потребует 4 человека. Люди могут полагать, что поскольку значение доверия не указано, существует 100% уверенность в том, что истинный результат находится в пределах предполагаемой погрешности. Это математически неверно. Многие люди не осознают, что случайность выборки имеет решающее значение. На практике многие опросы общественного мнения проводятся по телефону, что искажает выборку несколькими способами, включая исключение людей, не имеющих телефонов, предпочтение людей, у которых более одного телефона, предпочтение людей, готовых участвовать в телефонном опросе, по сравнению с теми, кто отказывается, и т.д. Неслучайная выборка делает оценку погрешности ненадежной. С другой стороны, люди могут считать статистику по своей природе ненадежной, потому что не всех опрашивают или потому что они сами никогда не участвуют в опросах. Люди могут думать, что невозможно получить данные о мнении десятков миллионов людей, опросив всего несколько тысяч. Это также неточно. Опрос с идеально несмещенной выборкой и правдивыми ответами имеет математически определенную погрешность, которая зависит только от количества опрошенных. Однако часто для опроса указывается только одна погрешность. При представлении результатов для подгрупп населения будет применяться большая погрешность, но это может быть не указано явно. Например, опрос 1000 человек может включать 100 человек из определенной этнической или экономической группы. Результаты, относящиеся к этой группе, будут гораздо менее надежными, чем результаты для всей совокупности. Если погрешность для всей выборки составляет, скажем, 4%, то погрешность для такой подгруппы может составлять около 13%. Существует также множество других проблем с измерениями в опросах населения. Вышеупомянутые проблемы применимы ко всем статистическим экспериментам, а не только к опросам населения.

Доказательство нулевой гипотезы

В статистическом тесте нулевая гипотеза считается верной до тех пор, пока не будет собрано достаточно данных, чтобы опровергнуть её. Тогда она отвергается, и альтернативная гипотеза считается доказанной. Однако, даже если нулевая гипотеза верна, это может произойти случайно, с вероятностью, обозначаемой α (уровнем значимости). Это можно сравнить с судебным процессом, где обвиняемый считается невиновным, пока его вина не будет доказана вне разумных сомнений. Но если данные не предоставляют достаточных оснований для отвержения нулевой гипотезы, это не означает автоматически, что она верна. Например, производитель табака, желая доказать безопасность своей продукции, может провести исследование на небольшой выборке курильщиков и некурящих. Маловероятно, что у кого-либо из них разовьется рак легких (и даже если это произойдет, разница между группами должна быть очень существенной, чтобы отвергнуть нулевую гипотезу). Следовательно, даже если курение опасно, наш тест может не отвергнуть нулевую гипотезу. Принятие нулевой гипотезы не доказывает, что курение безвредно. Тест не обладает достаточной мощностью для её отклонения, поэтому он бесполезен, и ценность такого "доказательства" равна нулю. Это можно сравнить с виновным подсудимым, который освобождается из-за недостатка доказательств для вынесения обвинительного приговора. Это не доказывает невиновность подсудимого, а лишь то, что доказательств для признания его виновным недостаточно.

"Нулевая гипотеза никогда не доказывается или не устанавливается, но может быть опровергнута в ходе эксперимента. Каждый эксперимент можно рассматривать как возможность для фактов опровергнуть нулевую гипотезу." (Фишер, "Дизайн экспериментов"). Существует множество причин для путаницы, включая использование двойной отрицательной логики и терминологии, возникшей в результате объединения "тестирования значимости" Фишера (где нулевая гипотеза никогда не принимается) с "проверкой гипотез" (где какая-либо гипотеза всегда принимается).

Смешивание статистической значимости с практической значимостью

Статистическая значимость – это мера вероятности, а практическая значимость – мера эффекта. Лечение от облысения статистически значимо, если на ранее лысой коже головы появляется легкий пушок. Лечение становится практически значимым, когда в холодную погоду больше не нужна шапка, а парикмахер спрашивает, сколько нужно подстричь сверху. Лысеющие хотят лечения, которое было бы значимо и статистически, и практически: чтобы оно, скорее всего, работало и, если работало, давало заметный результат. Научные публикации часто требуют лишь статистической значимости. Это на протяжении последних 50 лет вызывает критику, поскольку проверка статистической значимости считается некорректным применением статистики.

Дренаж данных

Извлечение данных – это злоупотребление методами анализа данных. При извлечении данных большие массивы информации исследуются с целью выявления корреляций, без предварительного определения гипотезы для проверки. Поскольку обычно используемый уровень доверительной вероятности для установления связи между двумя параметрами составляет 95% (то есть существует 95% вероятность того, что наблюдаемая связь не является случайной), существует 5% вероятность обнаружения корреляции между любыми двумя совершенно случайными наборами данных. Учитывая, что при извлечении данных обычно анализируются большие наборы данных с множеством переменных, а следовательно, и с огромным количеством пар переменных, ложные, но кажущиеся статистически значимыми результаты практически неизбежно будут обнаружены в любом подобном исследовании. Важно отметить, что извлечение данных может быть полезным для формулировки гипотезы, но эта гипотеза должна быть затем проверена на данных, которые не использовались при первоначальном извлечении. Злоупотребление возникает, когда эта гипотеза представляется как установленный факт без дальнейшей проверки. "Нельзя обоснованно проверять гипотезу на тех же данных, которые впервые навели на мысль о ее существовании. Решение очевидно: как только у вас сформировалась гипотеза, спланируйте исследование, направленное на поиск именно этого эффекта. Если результат этого исследования статистически значим, у вас наконец-то появятся реальные доказательства."

Манипуляция данными

Неформально называемая "фальсификацией данных", эта практика включает в себя выборочное представление результатов (см. также предвзятость публикаций) и даже прямое выдумывание ложных данных. Примеров выборочного представления результатов предостаточно. Самые простые и распространенные примеры заключаются в выборе группы результатов, соответствующих предпочтительной гипотезе, при игнорировании других результатов или "серий данных", которые противоречат гипотезе. Ученые в целом ставят под сомнение достоверность результатов исследований, которые не могут быть воспроизведены другими исследователями. Однако некоторые ученые отказываются публиковать свои данные и методы. Манипулирование данными – серьезная проблема, которую необходимо учитывать даже при самом добросовестном статистическом анализе. Выбросы, пропущенные данные и отсутствие нормального распределения могут негативно сказаться на достоверности статистического анализа. Перед началом анализа целесообразно изучить данные и устранить реальные проблемы. "[В] любой диаграмме рассеяния будут некоторые точки, более или менее отстоящие от основной массы облака: эти точки следует исключать только по обоснованной причине."

Другие заблуждения

Псевдорепликация – это техническая ошибка, связанная с анализом дисперсии. Сложность скрывает тот факт, что статистический анализ проводится на основе единственного образца (N=1). Для этого предельного случая дисперсия не может быть вычислена (деление на ноль). (N=1) всегда предоставит исследователю наивысшую статистическую корреляцию между предвзятостью и фактическими результатами. Ошибка игрока заключается в предположении, что вероятность события, для которого можно измерить будущую вероятность, была такой же, как и после того, как оно уже произошло. Таким образом, если кто-то уже подбросил 9 монет, и каждая из них выпала орлом, люди склонны полагать, что вероятность выпадения орла при десятом броске составляет 1023 к 1 против (какой она и была до первого броска), в то время как на самом деле вероятность выпадения орла при десятом броске составляет 50% (при условии, что монета не смещена). Ошибка прокурора заключается в предположении, что вероятность случайного совпадения, объясняющего очевидное преступное событие, равна вероятности невиновности подозреваемого. Ярким примером в Великобритании является ошибочное осуждение Салли Кларк за убийство ее двух сыновей, которые, по-видимому, умерли от синдрома внезапной детской смерти (СВДС). В своих экспертных показаниях, ныне дискредитированный профессор сэр Рой Медоу утверждал, что из-за редкости СВДС вероятность невиновности Кларк составляет 1 к 73 миллионам. Позже это было поставлено под сомнение Королевским статистическим обществом; предполагая, что оценка Медоу была точной, необходимо сопоставить все возможные объяснения, чтобы прийти к выводу о наиболее вероятной причине необъяснимой смерти двух детей. Имеющиеся данные показывают, что вероятность двойного СВДС по сравнению с двойным убийством выше в девять раз. Показатель 1 к 73 миллионам также был вводящим в заблуждение, поскольку он был получен путем вычисления вероятности смерти ребенка из обеспеченной, некурящей семьи от СВДС и возведения ее в квадрат: это ошибочно рассматривает каждую смерть как статистически независимую, предполагая отсутствие фактора, такого как генетика, который мог бы повысить вероятность смерти двух братьев от СВДС. Это также пример экологической ошибки, поскольку предполагается, что вероятность СВДС в семье Кларк была такой же, как и средняя для всех обеспеченных, некурящих семей; социальный класс – это чрезвычайно сложная и многогранная концепция, включающая множество других переменных, таких как образование, род занятий и многое другое. Предположение, что индивид будет обладать теми же характеристиками, что и остальная часть данной группы, не учитывает влияние других переменных, что, в свою очередь, может ввести в заблуждение. Обманчивость упрощения. Вероятности основаны на простых моделях, игнорирующих реальные (хотя и маловероятные) возможности. Игроки в покер не учитывают, что противник может достать пистолет вместо карты. Страхователи (и правительства) предполагают, что страховщики останутся платежеспособными, но вспомните AIG и системный риск.

Другие виды злоупотреблений

Другие некорректные приемы включают сравнение несравнимых вещей, использование неподходящего среднего значения, регрессию к среднему и общее выражение "мусор на входе – мусор на выходе". Некоторые статистические данные попросту нерелевантны рассматриваемому вопросу. Определенные рекламные формулировки, такие как "[более] 99 из 100", могут быть неверно истолкованы как 100%. Квартет Анскомба – это искусственно созданный набор данных, демонстрирующий недостатки простой описательной статистики (и важность визуализации данных перед проведением численного анализа).