Введение
Ситуация, когда среднее значение множества измерений существенно отличается от истинного значения. Статистическая предвзятость, в математической области статистики, – это систематическая тенденция, при которой методы сбора данных и формирования статистики приводят к неточному, искаженному или смещенному отражению действительности. Статистическая предвзятость проявляется на различных этапах процесса сбора и анализа данных, включая: источник данных, методы сбора данных, выбранный оцениватель и методы анализа данных. Аналитики данных могут предпринимать различные меры на каждом этапе процесса для снижения влияния статистической предвзятости в своей работе. Понимание источника статистической предвзятости помогает оценить, насколько полученные результаты соответствуют реальности. Вопросы статистической предвзятости тесно связаны с вопросами статистической валидности. Статистическая предвзятость может иметь значительные последствия в реальном мире, поскольку данные используются для принятия решений в самых разных сферах общественной жизни. Данные служат основой для разработки законодательства, регулирования отраслей, корпоративных маркетинговых и дистрибутивных стратегий, а также институциональной политики в организациях и на рабочих местах. Поэтому, если статистическая предвзятость не учитывается и не контролируется, это может привести к серьезным последствиям. Например, если фармацевтическая компания изучает влияние лекарства на простуду, но в выборку данных включены только мужчины, любые выводы, сделанные на основе этих данных, будут относиться только к мужчинам, а не к людям в целом. Это означает, что информация будет неполной и бесполезной для принятия решения о возможности выпуска препарата для широкой публики. В этом случае предвзятость можно устранить, расширив выборку. Эта ошибка выборки – лишь один из способов проявления предвзятости в данных. Предвзятость следует отличать от других статистических ошибок, таких как точность (неисправность/недостаточность прибора), отсутствие данных или ошибки при транскрипции (опечатки). Предвзятость подразумевает, что выбор данных мог быть искажен критериями сбора. Другие формы предвзятости, связанные с человеческим фактором, также возникают при сборе данных, например, предвзятость ответов, когда участники предоставляют неточные ответы на вопросы. Предвзятость не исключает наличия других ошибок. Может быть, например, плохо спроектированная выборка, неточный измерительный прибор и опечатки при записи данных одновременно. В идеале все факторы должны контролироваться и учитываться. Также полезно помнить, что термин «ошибка» относится конкретно к результату, а не к процессу (ошибки принятия или отклонения проверяемой гипотезы) или к феномену случайных ошибок. Для обозначения процедурных ошибок рекомендуется использовать термины «недостаток» или «ошибка», чтобы отделить их от специально определенных терминов, основанных на результатах.
Statistical bias, in the mathematical field of statistics, is a systematic tendency in which the methods used to gather data and generate statistics present an inaccurate, skewed or biased depiction of reality. Statistical bias exists in numerous stages of the data collection and analysis process, including: the source of the data, the methods used to collect the data, the estimator chosen, and the methods used to analyze the data. Data analysts can take various measures at each stage of the process to reduce the impact of statistical bias in their work. Understanding the source of statistical bias can help to assess whether the observed results are close to actuality. Issues of statistical bias has been argued to be closely linked to issues of statistical validity. Statistical bias can have significant real world implications as data is used to inform decision making across a wide variety of processes in society. Data is used to inform lawmaking, industry regulation, corporate marketing and distribution tactics, and institutional policies in organizations and workplaces. Therefore, there can be significant implications if statistical bias is not accounted for and controlled. For example, if a pharmaceutical company wishes to explore the effect of a medication on the common cold but the data sample only includes men, any conclusions made from that data will be biased towards how the medication affects men rather than people in general. That means the information would be incomplete and not useful for deciding if the medication is ready for release in the general public. In this scenario, the bias can be addressed by broadening the sample. This sampling error is only one of the ways in which data can be biased. Bias can be differentiated from other statistical mistakes such as accuracy (instrument failure/inadequacy), lack of data, or mistakes in transcription (typos). Bias implies that the data selection may have been skewed by the collection criteria. Other forms of human based bias emerge in data collection as well such as response bias, in which participants give inaccurate responses to a question. Bias does not preclude the existence of any other mistakes. One may have a poorly designed sample, an inaccurate measurement device, and typos in recording data simultaneously. Ideally, all factors are controlled and accounted for. Also it is useful to recognize that the term “error” specifically refers to the outcome rather than the process (errors of rejection or acceptance of the hypothesis being tested), or from the phenomenon of random errors. The terms flaw or mistake are recommended to differentiate procedural errors from these specifically defined outcome based terms.
Склонность оценщика
Статистическая систематическая ошибка – это характеристика статистического метода или его результатов, при которой математическое ожидание результатов отличается от истинного базового количественного параметра, который оценивается. Систематическая ошибка оценки параметра не должна смешиваться с его точностью, поскольку точность является мерой ошибки выборки. Систематическая ошибка определяется следующим образом: пусть – статистика, используемая для оценки параметра , и пусть обозначает математическое ожидание . Тогда
называется систематической ошибкой статистики (относительно ). Если , то считается несмещенной оценкой ; в противном случае, она считается смещенной оценкой .
Систематическая ошибка статистики всегда рассматривается относительно параметра , который используется для ее оценки, но параметр часто опускается, когда из контекста понятно, что оценивается.
The bias of a statistic is always relative to the parameter it is used to estimate, but the parameter is often omitted when it is clear from the context what is being estimated.
Типы
Статистическая погрешность возникает на всех этапах анализа данных. Источники погрешности будут перечислены отдельно для каждого этапа.
Выбор данных
Смещение отбора заключается в том, что некоторые люди с большей вероятностью попадают в исследование, чем другие, что искажает выборку. Это также может называться эффектом отбора, смещением выборки и смещением Берксона. Смещение спектра возникает из-за оценки диагностических тестов на смещенных группах пациентов, что приводит к завышению чувствительности и специфичности теста. Например, высокая распространенность заболевания в исследуемой популяции повышает положительные прогностические значения, что вызывает расхождение между прогностическими и реальными значениями. Смещение отбора наблюдателем возникает, когда представленные данные предварительно отфильтрованы наблюдателями, что известно как антропный принцип. Собранные данные фильтруются не только дизайном эксперимента, но и необходимым условием, что исследование проводит кто-то. Примером может служить воздействие на Землю в прошлом. Это воздействие могло привести к вымиранию разумных животных, или разумных животных в то время не существовало. Следовательно, некоторые события воздействия остались незамеченными, хотя могли произойти в прошлом. Смещение добровольцев возникает, когда добровольцы имеют принципиально иные характеристики, чем целевая популяция исследования. Исследования показали, что добровольцы, как правило, происходят из семей с более высоким социально-экономическим статусом. Кроме того, другое исследование показало, что женщины охотнее участвуют в исследованиях, чем мужчины. Смещение финансирования может привести к выбору результатов, образцов для тестирования или процедур тестирования, которые благоприятствуют финансовому спонсору исследования. Смещение из-за выбывания участников возникает из-за потери участников, например, потери наблюдения в ходе исследования. Смещение памяти возникает из-за различий в точности или полноте воспоминаний участников о прошлых событиях; например, пациенты не могут точно вспомнить, сколько сигарет они выкурили на прошлой неделе, что приводит к завышению или занижению оценки.
Испытание гипотезы
Ошибки первого и второго рода при проверке статистических гипотез приводят к неверным результатам. Ошибка первого рода возникает, когда нулевая гипотеза верна, но отвергается. Например, предположим, что нулевая гипотеза заключается в том, что если средняя скорость движения находится в диапазоне от 75 до 85 км/ч, это не считается превышением скорости. С другой стороны, если средняя скорость не входит в этот диапазон, это считается превышением скорости. Если кто-то получает штраф при средней скорости движения 7 км/ч, то лицо, принимающее решение, совершило ошибку первого рода. Иными словами, средняя скорость движения соответствует нулевой гипотезе, но она отклонена. Напротив, ошибка второго рода возникает, когда нулевая гипотеза неверна, но принимается. Смещение при проверке гипотез возникает, когда мощность (величина, дополняющая вероятность ошибки второго рода) для некоторой альтернативной гипотезы ниже, чем супремум вероятности ошибки первого рода (который обычно является уровнем значимости, α). Эквивалентно, если частота отклонения для любой альтернативной гипотезы не ниже частоты отклонения в любой точке множества нулевых гипотез, то тест считается несмещенным.
Выбор оценщика
Смещение оценщика — это разница между математическим ожиданием оценщика и истинным значением оцениваемого параметра. Хотя теоретически предпочтительнее использовать несмещенный оценщик, чем смещенный, на практике часто используются смещенные оценщики с небольшим смещением. Смещенный оценщик может быть более полезным по нескольким причинам. Во-первых, несмещенный оценщик может не существовать без дополнительных предположений. Во-вторых, иногда несмещенный оценщик сложно вычислить. В-третьих, смещенный оценщик может иметь меньшую среднеквадратичную ошибку. Смещенный оценщик превосходит любой несмещенный оценщик, полученный из распределения Пуассона. Значение смещенного оценщика всегда положительно, а его среднеквадратичная ошибка меньше, чем у несмещенного, что делает смещенный оценщик более точным. Смещение из-за пропущенной переменной — это смещение, возникающее при оценке параметров в регрессионном анализе, когда в предполагаемой спецификации отсутствует независимая переменная, которая должна быть включена в модель.
Методы анализа
Склонность к обнаружению возникает, когда явление с большей вероятностью выявляется у определенной группы участников исследования. Например, взаимосвязь между ожирением и диабетом может приводить к тому, что врачи чаще проверяют пациентов с ожирением на наличие диабета, чем пациентов с нормальным весом, что приводит к завышению показателей диабета среди людей с ожирением из-за неравномерности в усилиях по диагностике. В области образовательных измерений, предвзятость определяется как "Систематические ошибки в содержании теста, процедуре его проведения и/или в оценке результатов, которые могут привести к тому, что некоторые участники получат баллы, не соответствующие их фактическому уровню знаний и умений". Источник предвзятости не имеет значения для измеряемого признака. Предвзятость наблюдателя возникает, когда исследователь неосознанно влияет на ход эксперимента из-за когнитивных искажений, что может изменить способ проведения эксперимента или записи результатов.
Интерпретация
Смещение отчетности возникает из-за неравномерного представления данных, когда наблюдения определенного рода с большей вероятностью становятся известными.
Решение проблемы статистической предвзятости
В зависимости от типа смещения, исследователи и аналитики могут предпринять различные шаги для снижения смещения в наборе данных. Для каждого из вышеупомянутых видов смещения существуют соответствующие меры, которые можно принять для уменьшения или устранения его влияния. Смещение необходимо учитывать на каждом этапе сбора данных, начиная с четко определенных параметров исследования и состава команды, которая будет проводить исследование. Внимательное использование языка при составлении отчетов может уменьшить количество вводящих в заблуждение формулировок, например, обсуждение результата, "приближающегося" к статистической значимости, вместо констатации ее фактического достижения.