Введение
Смещение выборки — это систематическая ошибка, возникающая при сборе данных, когда вероятность включения в выборку у некоторых членов генеральной совокупности отличается от вероятности включения у других. Это приводит к формированию смещенной выборки, в которой не все индивиды или случаи имели равные шансы быть отобранными. Если это не учитывается, результаты исследования могут быть ошибочно отнесены к изучаемому явлению, а не к методу выборки. В медицинской литературе смещение выборки иногда называют смещением выявления. Смещение выявления имеет практически такое же определение, но иногда классифицируется как отдельный вид систематической ошибки.
In statistics, sampling bias is a bias in which a sample is collected in such a way that some members of the intended population have a lower or higher sampling probability than others. It results in a biased sample of a population (or non human factors) in which all individuals, or instances, were not equally likely to have been selected. If this is not accounted for, results can be erroneously attributed to the phenomenon under study rather than to the method of sampling. Medical sources sometimes refer to sampling bias as ascertainment bias. Ascertainment bias has basically the same definition, but is still sometimes classified as a separate type of bias.
Отличие от отклонения от выбора
Смещение выборки обычно классифицируется как подтип смещения отбора, иногда конкретно называемого смещением, связанным с выбором выборки, но некоторые классифицируют его как отдельный тип смещения. Различие, хотя и не повсеместно признанное, заключается в том, что смещение выборки подрывает внешнюю валидность исследования (возможность обобщения его результатов на всю популяцию), в то время как смещение отбора в основном касается внутренней валидности различий или сходств, обнаруженных в рассматриваемой выборке. В этом смысле ошибки, возникающие в процессе формирования выборки или когорты, приводят к смещению выборки, а ошибки на любом последующем этапе – к смещению отбора. Однако термины «смещение выборки» и «смещение отбора» часто используются как синонимы.
Типы
Выборка из конкретной реальной области. Например, опрос старшеклассников для оценки употребления наркотиков подростками будет смещенной выборкой, поскольку в нее не включены учащиеся на домашнем обучении или отчисленные. Выборка также будет смещена, если определенные группы будут недостаточно или избыточно представлены по сравнению с другими в популяции. Например, интервью "на улице", в котором опрашиваются прохожие в определенном месте, будет содержать перепредставленность здоровых людей, которые с большей вероятностью находятся вне дома, чем люди с хроническими заболеваниями. Это может быть крайней формой смещенной выборки, поскольку некоторые члены популяции полностью исключены из выборки (то есть, их вероятность быть выбранными равна нулю). Смещение самоотбора (см. также смещение, связанное с отсутствием ответов), которое возникает всякий раз, когда изучаемая группа людей имеет какой-либо контроль над участием в исследовании (как того требуют современные стандарты этики исследований с участием людей для многих исследований в реальном времени и некоторых лонгитюдных исследований). Решение участников об участии может быть связано с характеристиками, влияющими на исследование, что делает участников нерепрезентативной выборкой. Например, люди со стойкими убеждениями или значительными знаниями могут быть более склонны тратить время на ответы на опрос, чем те, кто не обладает ими. Другой пример – онлайн-опросы и опросы по телефону, которые являются смещенными выборками, поскольку респонденты самоотбираются. Люди, которые сильно мотивированы на участие, как правило, люди со стойкими убеждениями, оказываются перепредставленными, а люди, безразличные или апатичные, реже отвечают. Это часто приводит к поляризации ответов, когда крайние точки зрения получают непропорционально большой вес в итоговых результатах. В результате такие опросы считаются ненаучными. Смещение исключения возникает из-за исключения определенных групп из выборки, например, исключения участников, недавно переехавших в изучаемую область (это может произойти, когда новоприбывшие отсутствуют в реестре, используемом для определения исходной популяции). Исключение участников, выбывающих из исследования во время наблюдения, скорее эквивалентно выбыванию или отсутствию ответов, смещению отбора, поскольку оно скорее влияет на внутреннюю валидность исследования. Смещение в пользу здоровых пользователей, когда изучаемая популяция, вероятно, более здорова, чем общая популяция. Например, человек с плохим здоровьем вряд ли будет работать физическим трудом, поэтому, если исследование проводится среди рабочих, здоровье населения в целом, вероятно, будет переоценено. Ошибка Берксона, когда изучаемая популяция отбирается из больницы и поэтому менее здорова, чем общая популяция. Это может привести к ложной отрицательной корреляции между заболеваниями: у пациента в больнице без диабета с большей вероятностью будет другое заболевание, такое как холецистит, поскольку у него должна была быть причина для обращения в больницу в первую очередь. Чрезмерное сопоставление, сопоставление по очевидному искажающему фактору, который на самом деле является результатом воздействия. Контрольная группа становится более похожей на случаи в отношении воздействия, чем общая популяция. Смещение выжившего, при котором отбираются только "выжившие" участники, игнорируя тех, кто выпал из поля зрения. Например, использование данных о существующих компаниях в качестве индикатора делового климата или экономики игнорирует предприятия, которые обанкротились и больше не существуют. Смещение Малмквиста, эффект в наблюдательной астрономии, который приводит к предпочтительному обнаружению внутренне ярких объектов. Эффект прожектора, некритическое предположение, что все члены или случаи определенного класса или типа похожи на те, которые получают наибольшее внимание или освещение в СМИ.
Отбор проб на основе симптомов
Изучение заболеваний начинается с отдельных случаев и наблюдений. По самой своей природе, такие сообщения отражают данные только о тех, кто обратился за диагностикой и лечением. Ребенок, испытывающий трудности в учебе, с большей вероятностью будет диагностирован с дислексией, чем ребенок, который с трудом справляется, но все же успешно учится. Ребенок, обследованный по поводу одного состояния, с большей вероятностью будет проверен и диагностирован с другими состояниями, что искажает статистику по сопутствующим заболеваниям. Поскольку определенные диагнозы ассоциируются с поведенческими проблемами или интеллектуальной недостаточностью, родители стремятся уберечь своих детей от стигматизации этими диагнозами, внося дополнительную предвзятость. Исследования, тщательно отобранные из общих популяций, показывают, что многие состояния встречаются гораздо чаще и обычно протекают в более легкой форме, чем считалось ранее.
Отбор в исследованиях родословной
Генетики ограничены в способах получения данных о человеческих популяциях. В качестве примера рассмотрим один человеческий признак. Нас интересует, наследуется ли этот признак как простой менделевский признак. Согласно законам менделевского наследования, если родители в семье не проявляют признак, но несут аллель для него, они являются носителями (например, неэкспрессивный гетерозигот). В этом случае у каждого из их детей будет 25% вероятность проявления признака. Проблема заключается в том, что мы не можем определить, в каких семьях оба родителя являются носителями (гетерозиготными), если у них нет ребенка, проявляющего этот признак. Описание основано на учебнике Саттон. На рисунке представлены родословные всех возможных семей с двумя детьми, когда родители являются носителями (Aa). Отбор без усечения. В идеальном мире мы должны быть способны выявить все такие семьи с геном, включая тех, кто является просто носителями. В этой ситуации анализ был бы свободен от систематической ошибки отбора, а родословные подпадали бы под "отбор без усечения". На практике большинство исследований идентифицируют и включают в исследование семьи на основании наличия у них пораженных индивидуумов. Усеченный отбор. Когда пораженные индивидуумы имеют равные шансы быть включенными в исследование, это называется усеченным отбором, что указывает на непреднамеренное исключение (усечение) семей, являющихся носителями гена. Поскольку отбор проводится на индивидуальном уровне, семьи с двумя или более пораженными детьми имеют более высокую вероятность включения в исследование. Полный усеченный отбор – это особый случай, когда каждая семья с пораженным ребенком имеет равные шансы быть отобрана для исследования. Вероятности отбора каждой семьи представлены на рисунке, а также указана частота встречаемости пораженных детей в выборке. В этом простом случае исследователь будет искать частоту 4/7 или 5/8 для признака, в зависимости от типа используемого усеченного отбора.
Эффект пещерного человека
Примером систематической ошибки отбора является так называемый «эффект пещерного человека». Большая часть наших знаний о древних людях основана на находках в пещерах, таких как наскальные рисунки, созданные почти 40 000 лет назад. Если бы существовали аналогичные изображения на деревьях, шкурах животных или склонах холмов, они бы давно не сохранились. Точно так же, следы кострищ, кухонных отходов, захоронений и т.п. с наибольшей вероятностью уцелели до наших дней именно в пещерах. Древние люди ассоциируются с пещерами не потому, что большинство из них жили в пещерах на протяжении большей части своей жизни, а потому, что именно там сохранились данные об их существовании.
Проблемы, вызванные искажением выборки
Систематическая ошибка выборки является проблемой, поскольку существует вероятность того, что статистика, вычисленная на основе выборки, будет систематически неверной. Систематическая ошибка выборки может приводить к систематической переоценке или недооценке соответствующего параметра в генеральной совокупности. Ошибка выборки возникает на практике, поскольку практически невозможно обеспечить полную случайность при отборе проб. Если степень искажения невелика, то выборку можно считать разумным приближением к случайной выборке. Кроме того, если выборка не сильно отличается по измеряемому показателю, то смещенная выборка все равно может быть разумной оценкой. Слово "смещение" имеет ярко выраженную негативную коннотацию. Действительно, смещения иногда возникают из-за преднамеренного намерения ввести в заблуждение или других видов научного мошенничества. В статистическом смысле, смещение – это просто математическое свойство, независимо от того, является ли оно преднамеренным или неосознанным, или связано с несовершенством инструментов, используемых для наблюдений. Хотя некоторые люди могут намеренно использовать смещенную выборку для получения вводящих в заблуждение результатов, чаще смещенная выборка является лишь отражением сложности получения действительно репрезентативной выборки или незнания смещения в процессе измерения или анализа. Примером незнания смещения является широкое использование отношения (также известного как кратное изменение) в качестве меры различий в биологии. Поскольку легче получить большое отношение, используя два небольших числа с заданной разницей, и сложнее получить большое отношение, используя два больших числа с большей разницей, значительные различия могут быть упущены при сравнении относительно больших числовых значений. Некоторые называют это "демаркационным смещением", поскольку использование отношения (деления) вместо разницы (вычитания) выводит результаты анализа из области науки в область псевдонауки (см. Проблема демаркации). Некоторые выборки используют смещенный статистический дизайн, который, тем не менее, позволяет оценивать параметры. Например, Национальный центр статистики здравоохранения США намеренно проводит перевыборку из числа представителей меньшинств во многих своих общенациональных опросах, чтобы обеспечить достаточную точность оценок внутри этих групп. Для этих опросов требуется использование весов выборки (см. далее) для получения корректных оценок по всем этническим группам. При соблюдении определенных условий (в основном, правильности расчета и использования весов) эти выборки позволяют точно оценивать параметры генеральной совокупности.
Исторические примеры
Классический пример смещённой выборки и вводящих в заблуждение результатов, к которым она привела, произошел в 1936 году. В первые дни развития опросов общественного мнения журнал "Американский литературный дайджест" собрал более двух миллионов почтовых анкет и предсказал, что кандидат от Республиканской партии на президентских выборах в США, Альф Лэндон, с большим отрывом победит действующего президента Франклина Рузвельта. Однако результат оказался совершенно противоположным. Опрос "Литературного дайджеста" представлял собой выборку, составленную из читателей журнала, дополненную данными о зарегистрированных владельцах автомобилей и пользователях телефонов. Эта выборка была непропорционально представлена состоятельными людьми, которые, как группа, с большей вероятностью проголосовали бы за кандидата от Республиканской партии. В отличие от этого, опрос, проведенный организацией Джорджа Гэллапа среди всего 50 тысяч граждан, успешно предсказал исход выборов, что способствовало популярности опросов Гэллапа. Другой классический пример произошел на президентских выборах 1948 года. В ночь выборов "Чикаго Трибьюн" напечатала заголовок "Дьюи побеждает Трумэна", который оказался ошибочным. Утром улыбающийся избранный президент Гарри С. Трумэн был сфотографирован с газетой, на первой полосе которой был напечатан этот заголовок. Причина ошибки "Трибьюн" заключалась в том, что их редактор доверял результатам телефонного опроса. Исследования в области опросов тогда находились в зачаточном состоянии, и немногие ученые осознавали, что выборка пользователей телефонов не является репрезентативной для всего населения. Телефоны еще не были широко распространены, и те, у кого они были, как правило, были обеспечены и имели постоянный адрес. (Во многих городах телефонный справочник Bell System содержал те же имена, что и в Социальном реестре). Кроме того, опрос Гэллапа, на основе которого "Трибьюн" сделала свой заголовок, был опубликован более двух недель назад. В данных о качестве воздуха загрязняющие вещества (такие как монооксид углерода, монооксид азота, диоксид азота или озон) часто демонстрируют высокую корреляцию, поскольку они являются результатом одних и тех же химических процессов. Эти корреляции зависят от пространства (то есть местоположения) и времени (то есть периода). Следовательно, распределение загрязняющих веществ не обязательно является репрезентативным для каждого местоположения и каждого периода времени. Если недорогой измерительный прибор калибруется с использованием полевых данных многомерным способом, а точнее – путем совместного размещения рядом с эталонным прибором, то взаимосвязи между различными соединениями включаются в модель калибровки. Перемещением измерительного прибора можно получить ошибочные результаты. Примером из XXI века является пандемия COVID-19, где было показано, что различия в систематической ошибке выборки при тестировании на COVID-19 объясняют значительные различия как в показателях смертности, так и в возрастном распределении случаев заболевания в разных странах.
Статистические коррекции для смешанной выборки
Если целые сегменты населения исключены из выборки, то никакие корректировки не могут дать оценки, репрезентативные для всего населения. Но если некоторые группы недостаточно представлены, и степень этой недопредставленности может быть количественно оценена, то веса выборки могут скорректировать смещение. Однако эффективность коррекции ограничена выбранной моделью отбора. Если определенные переменные отсутствуют, методы, используемые для коррекции смещения, могут быть неточными. Например, гипотетическая популяция может состоять из 10 миллионов мужчин и 10 миллионов женщин. Предположим, что в предвзятой выборке из 100 пациентов содержится 20 мужчин и 80 женщин. Исследователь может скорректировать этот дисбаланс, присвоив каждому мужчине вес 2,5, а каждой женщине – 0,625. Это позволит скорректировать любые оценки, чтобы они имели то же ожидаемое значение, что и выборка, состоящая ровно из 50 мужчин и 50 женщин, если только вероятность участия в опросе не различается для мужчин и женщин.