Введение
Выбор точек данных в статистике. В статистике, обеспечении качества и методологии опросов, выборка – это отбор подмножества или статистической выборки (сокращенно – выборки) из генеральной совокупности для оценки характеристик всей совокупности. Подмножество должно отражать всю генеральную совокупность, и статистики стремятся получить выборки, репрезентативные для этой совокупности. Выборка позволяет снизить затраты и ускорить сбор данных по сравнению с регистрацией данных по всей генеральной совокупности, и таким образом, предоставляет возможность получить информацию в тех случаях, когда измерение всей совокупности не представляется возможным. Каждое наблюдение измеряет одно или несколько свойств (например, вес, местоположение, цвет или массу) независимых объектов или индивидуумов. В выборочных обследованиях к данным могут применяться веса для корректировки, учитывающей структуру выборки, особенно при стратифицированной выборке. Результаты теории вероятностей и статистической теории используются для руководства практикой. В бизнес-исследованиях и медицине выборка широко используется для сбора информации о генеральной совокупности. Контроль выборочного приема используется для определения соответствия производственной партии материала действующим спецификациям.
История
Случайная выборка с использованием жребия – это старая идея, упоминаемая несколько раз в Библии. В 1786 году Пьер Симон Лаплас оценил население Франции, используя выборку и оценку отношения. Он также вычислил вероятностные оценки ошибки. Они не были выражены в виде современных доверительных интервалов, а представляли собой размер выборки, необходимый для достижения определенного верхнего предела погрешности выборки с вероятностью 1000/1001. В своих оценках он использовал теорему Байеса с равномерным априорным распределением вероятностей и исходил из того, что его выборка была случайной. Александр Иванович Чупров внедрил выборочные обследования в Императорскую Россию в 1870-х годах. В США в 1936 году предсказание журнала «Литературный дайджест» о победе республиканцев на президентских выборах оказалось серьезно ошибочным из-за сильной предвзятости. Более двух миллионов человек приняли участие в исследовании, предоставив свои имена из списков подписчиков журналов и телефонных справочников. Не было учтено, что эти списки были сильно смещены в пользу республиканцев, и полученная выборка, несмотря на большой размер, была серьезно дефектной. На выборах в Сингапуре эта практика применяется с 2015 года, также известная как предварительный подсчет голосов. По данным Департамента выборов (ELD), избирательной комиссии страны, предварительный подсчет голосов помогает снизить спекуляции и дезинформацию, а также позволяет избирательным должностным лицам сверять результаты с официальными данными по избирательному округу. Результаты предварительного подсчета голосов дают достаточно точный предварительный результат с 95% доверительным интервалом и погрешностью в пределах 4,5%. ELD напомнил общественности, что предварительный подсчет голосов отличается от официальных результатов, и только уполномоченный по выборам объявит официальные результаты после завершения подсчета голосов.
Определение численности населения
Успешная статистическая практика основана на четкой постановке проблемы. При отборе проб это включает определение "популяции", из которой формируется наша выборка. Популяцию можно определить как совокупность всех людей или объектов, обладающих характеристиками, которые необходимо изучить. Поскольку крайне редко есть достаточно времени или средств для сбора информации от каждого члена или объекта в популяции, целью становится нахождение репрезентативной выборки (или подмножества) этой популяции. Иногда определение популяции очевидно. Например, производителю необходимо решить, соответствует ли качество партии материала требованиям для отгрузки клиенту, или ее следует отбраковать или переработать из-за низкого качества. В этом случае партией является популяция. Хотя популяция, представляющая интерес, часто состоит из физических объектов, иногда необходимо проводить отбор проб во времени, пространстве или в их комбинации. Например, исследование штата супермаркета может изучать длину очереди на кассах в разное время, а исследование находящихся под угрозой исчезновения пингвинов может быть направлено на понимание использования ими различных охотничьих угодий с течением времени. Применительно к временному измерению, фокус может быть сосредоточен на периодах или конкретных моментах времени. В других случаях исследуемая "популяция" может быть еще менее осязаемой. Например, Джозеф Джаггер изучал поведение колес рулетки в казино Монте-Карло и использовал это для выявления колеса с предвзятостью. В этом случае "популяцией", которую хотел изучить Джаггер, было общее поведение колеса (то есть распределение вероятностей его результатов при бесконечном числе вращений), а его "выборкой" стали наблюдаемые результаты этого колеса. Подобные соображения возникают при многократных измерениях свойств материалов, таких как электрическая проводимость меди. Эта ситуация часто возникает при стремлении к пониманию причинной системы, результатом которой является наблюдаемая популяция. В таких случаях теория выборки может рассматривать наблюдаемую популяцию как выборку из более широкой "суперпопуляции". Например, исследователь может изучить эффективность новой программы по отказу от курения на тестовой группе из 100 пациентов, чтобы спрогнозировать эффект программы при ее общенациональном внедрении. Здесь суперпопуляцией является "все население страны, получившее доступ к этому лечению" – группа, которая пока не существует, поскольку программа еще не доступна всем. Популяция, из которой формируется выборка, может отличаться от популяции, для которой требуется информация. Часто между этими двумя группами существует значительное, но неполное перекрытие из-за проблем с выборкой и т.д. (см. ниже). Иногда они могут быть полностью разделены – например, можно изучать крыс, чтобы лучше понять здоровье человека, или изучать данные о людях, родившихся в 2008 году, чтобы делать прогнозы о людях, родившихся в 2009 году. Время, затраченное на точное определение выборочной популяции и популяции, представляющей интерес, часто окупается, поскольку это выявляет множество проблем, неоднозначностей и вопросов, которые в противном случае могли бы быть упущены на этом этапе.
Невероятностный отбор проб
Невероятностная выборка – это любой метод выборки, при котором у некоторых элементов генеральной совокупности нет возможности быть отобранными (они иногда называются "не охваченными" / "недостаточно охваченными"), или когда вероятность отбора не может быть точно определена. Она предполагает отбор элементов на основе предположений об интересующей генеральной совокупности, которые формируют критерии отбора. Следовательно, поскольку отбор элементов не случаен, невероятностная выборка не позволяет оценить ошибки выборки. Эти условия приводят к систематической ошибке исключения, ограничивая объем информации, которую выборка может предоставить о генеральной совокупности. Информация о взаимосвязи между выборкой и генеральной совокупностью ограничена, что затрудняет экстраполяцию результатов с выборки на генеральную совокупность. Пример: мы опрашиваем каждого, кто открывает дверь в домах на определенной улице, беседуя с первым ответившим. В любом доме, где проживает более одного человека, это невероятностная выборка, поскольку некоторые люди с большей вероятностью ответят на звонок (например, безработный, проводящий большую часть времени дома, вероятнее ответит, чем работающий сосед, который может быть на работе во время звонка), и рассчитать эти вероятности непрактично. Методы невероятностной выборки включают выборку удобства, квотную выборку и целевую выборку. Кроме того, эффект неответности может превратить любую вероятностную схему выборки в невероятностную, если характеристики неответности недостаточно изучены, поскольку неответность фактически изменяет вероятность отбора каждого элемента.
Простая выборка
В простой случайной выборке (SRS) заданного размера все подмножества генеральной совокупности имеют равную вероятность быть выбранными. Следовательно, каждый элемент генеральной совокупности имеет равную вероятность попадания в выборку: генеральная совокупность не подразделяется и не разбивается на части. Более того, любая пара элементов имеет такую же вероятность быть выбранной, как и любая другая пара (и аналогично для троек и так далее). Это минимизирует систематическую ошибку и упрощает анализ результатов. В частности, дисперсия между отдельными результатами в выборке является хорошим индикатором дисперсии в генеральной совокупности, что позволяет относительно легко оценить точность результатов. Простая случайная выборка может быть подвержена ошибке выборки, поскольку случайность отбора может привести к формированию выборки, не отражающей структуру генеральной совокупности. Например, простая случайная выборка из десяти человек в определенной стране в среднем даст пять мужчин и пять женщин, но в каждом конкретном случае выборка, скорее всего, будет перепредставлять один пол и недопредставлять другой. Систематические и стратифицированные методы отбора стремятся решить эту проблему, "используя информацию о генеральной совокупности" для выбора более "репрезентативной" выборки. Кроме того, простая случайная выборка может быть трудоемкой и утомительной при отборе из большой целевой популяции. В некоторых случаях исследователи заинтересованы в исследовательских вопросах, относящихся к конкретным подгруппам генеральной совокупности. Например, исследователи могут быть заинтересованы в изучении того, применима ли когнитивная способность как предиктор производительности труда в равной степени ко всем расовым группам. Простая случайная выборка не может удовлетворить потребности исследователей в этой ситуации, поскольку она не обеспечивает формирование подвыборок генеральной совокупности, и вместо этого могут быть использованы другие стратегии отбора, такие как стратифицированная выборка.
Систематический отбор проб
Систематическая выборка (также известная как интервальная выборка) основана на упорядочивании изучаемой совокупности в соответствии с определенной схемой и последующем выборе элементов через регулярные интервалы в этом упорядоченном списке. Систематический отбор включает случайное начало, а затем выбор каждого k-го элемента, начиная с этого момента. В этом случае k = (размер совокупности / размер выборки). Важно, чтобы начальная точка не была автоматически первым элементом в списке, а выбиралась случайным образом из первых k элементов списка. Простым примером может служить выбор каждого десятого имени из телефонного справочника (выборка "каждый десятый", также называемая "выборкой с шагом 10"). Пока начальная точка рандомизирована, систематический отбор является типом вероятностной выборки. Он прост в реализации, а индуцированная стратификация может сделать его эффективным, если переменная, по которой упорядочен список, коррелирует с интересующей переменной. Выборка "каждый десятый" особенно полезна для эффективного отбора данных из баз данных. Например, предположим, мы хотим отобрать людей с длинной улицы, которая начинается в бедном районе (дом № 1) и заканчивается в дорогом районе (дом № 1000). Простой случайный выбор адресов с этой улицы может легко привести к тому, что будет отобрано слишком много адресов из дорогого района и слишком мало из бедного (или наоборот), что приведет к нерепрезентативной выборке. Выбор (например) каждого 10-го номера дома вдоль улицы гарантирует, что выборка будет равномерно распределена по всей длине улицы, представляя все эти районы. (Если мы всегда начинаем с дома № 1 и заканчиваем на № 991, выборка будет слегка смещена в сторону нижнего диапазона; случайным выбором начала между № 1 и № 10 эта смещенность устраняется.) Однако систематический отбор особенно уязвим к периодичности в списке. Если периодичность присутствует, и период является кратным или делителем используемого интервала, выборка с большей вероятностью не будет представлять всю совокупность, что делает схему менее точной, чем простая случайная выборка. Например, представьте себе улицу, где дома с нечетными номерами расположены на северной (дорогой) стороне дороги, а дома с четными номерами – на южной (дешевой) стороне. При схеме выборки, описанной выше, невозможно получить репрезентативную выборку; либо все отобранные дома будут с нечетной, дорогой стороны, либо все они будут с четной, дешевой стороны, если только исследователь не знает об этой смещенности и не избежит ее, используя шаг, который обеспечивает переход между двумя сторонами (любой нечетный шаг). Другим недостатком систематического отбора является то, что даже в сценариях, когда он более точен, чем SRS, его теоретические свойства затрудняют количественную оценку этой точности. (В двух примерах систематического отбора, приведенных выше, большая часть потенциальной ошибки выборки связана с различиями между соседними домами, но поскольку этот метод никогда не выбирает два соседних дома, выборка не даст нам никакой информации об этих различиях.) Как описано выше, систематическая выборка является методом EPS, поскольку все элементы имеют одинаковую вероятность отбора (в приведенном примере – один из десяти). Это не "простая случайная выборка", поскольку разные подмножества одного размера имеют разные вероятности отбора – например, множество {4, 14, 24, ..., 994} имеет вероятность отбора один к десяти, но множество {4, 13, 24, 34, ...} имеет нулевую вероятность отбора. Систематический отбор также может быть адаптирован к подходу, отличному от EPS; пример см. в обсуждении выборок PPS ниже.
Стратифицированный отбор проб
Когда популяция разделена на несколько различных категорий, совокупность может быть организована по этим категориям в отдельные "страты". Затем из каждого страта производится отбор проб как из независимой подпопуляции, из которой отдельные элементы выбираются случайным образом. Данные стратифицируются по целевой переменной, и из каждого страта берется выборка таким образом, чтобы редкий целевой класс был более представлен в выборке. Модель затем строится на этой смещенной выборке. Влияние входных переменных на целевую переменную часто оценивается с большей точностью при использовании стратифицированной выборки, даже если общий размер выборки меньше, чем при случайной выборке. Результаты обычно требуют корректировки для учета передискретизации.
Выборка пропорциональная величине
В некоторых случаях разработчик выборки имеет доступ к "вспомогательной переменной" или "мере размера", которая, как предполагается, связана с интересующей переменной для каждого элемента в генеральной совокупности. Эти данные могут быть использованы для повышения точности при разработке выборки. Один из вариантов – использовать вспомогательную переменную в качестве основы для стратификации, как обсуждалось выше. Другой вариант – вероятностно-пропорциональная выборка по размеру (PPS), при которой вероятность отбора для каждого элемента устанавливается пропорционально его мере размера, но не превышает 1. В простой конструкции PPS эти вероятности отбора могут быть использованы в качестве основы для пуассоновской выборки. Однако это имеет недостаток в виде переменного размера выборки, и различные части генеральной совокупности могут по-прежнему быть перепредставлены или недостаточно представлены из-за случайных колебаний при отборе. Теория систематической выборки может быть использована для создания выборки, пропорциональной размеру. Это делается путем рассмотрения каждого значения в переменной размера как единицы выборки. Затем выборки идентифицируются путем отбора на равных интервалах среди этих значений в переменной размера. Этот метод иногда называют последовательной выборкой по ППС или выборкой денежных единиц в случае аудитов или криминалистической выборки. Пример: предположим, что у нас есть шесть школ с численностью учащихся 150, 180, 200, 220, 260 и 490 соответственно (всего 1500 учащихся), и мы хотим использовать численность учащихся в качестве основы для выборки PPS размером три. Для этого мы можем присвоить первой школе номера от 1 до 150, второй школе – от 151 до 330 (= 150 + 180), третьей школе – от 331 до 530 и так далее до последней школы (от 1011 до 1500). Затем мы генерируем случайное начальное число от 1 до 500 (равное 1500/3) и подсчитываем численность учащихся в школах с шагом 500. Если наше случайное начальное число равно 137, мы выберем школы, которым присвоены номера 137, 637 и 1137, то есть первую, четвертую и шестую школы. Подход PPS может повысить точность при заданном размере выборки, концентрируя выборку на больших элементах, которые оказывают наибольшее влияние на оценки генеральной совокупности. Выборка ППС обычно используется для обследований предприятий, где размер элемента сильно варьируется и часто доступна вспомогательная информация – например, опрос, направленный на измерение количества гостеночей, проведенных в отелях, может использовать количество номеров в каждом отеле в качестве вспомогательной переменной. В некоторых случаях более раннее измерение интересующей переменной может быть использовано в качестве вспомогательной переменной при попытке получить более актуальные оценки.
Кластерный отбор проб
Иногда более экономически эффективно отбирать респондентов в группах ("кластерах"). Отбор проб часто группируется по географическому признаку или по временным периодам. (Почти все выборки в некотором смысле "кластеризованы" во времени, хотя это редко учитывается при анализе.) Например, при проведении опроса домохозяйств в городе можно выбрать 100 городских кварталов и затем опросить каждое домохозяйство в выбранных кварталах. Кластеризация может снизить транспортные и административные расходы. В приведенном выше примере интервьюер может совершить одну поездку, чтобы посетить несколько домохозяйств в одном квартале, вместо того чтобы ездить в другой квартал для каждого домохозяйства. Это также означает, что не требуется реестр, содержащий перечень всех элементов целевой популяции. Вместо этого кластеры могут быть выбраны из реестра кластеров, а реестр элементов создается только для выбранных кластеров. В приведенном выше примере для первоначального отбора достаточно карты города по кварталам, а затем карты домохозяйств по 100 выбранным кварталам, а не карты домохозяйств всего города. Кластерный отбор (также известный как кластерная выборка) обычно увеличивает вариабельность оценок выборки по сравнению с простой случайной выборкой, в зависимости от того, насколько различаются кластеры друг от друга по сравнению с вариабельностью внутри кластеров. По этой причине для кластерного отбора проб требуется большая выборка, чем для простой случайной выборки (SRS), чтобы достичь того же уровня точности, но экономия затрат от кластеризации все равно может сделать этот вариант более дешевым. Кластерный отбор проб часто реализуется как многоступенчатая выборка. Это сложная форма кластерного отбора, в которой два или более уровня единиц вложены друг в друга. Первый этап состоит в формировании кластеров, из которых будет производиться отбор проб. На втором этапе из каждого кластера случайным образом отбирается выборка первичных единиц (вместо использования всех единиц, содержащихся во всех выбранных кластерах). На последующих этапах в каждом из выбранных кластеров отбираются дополнительные выборки единиц и так далее. Затем проводится опрос всех конечных единиц (например, индивидов), отобранных на последнем этапе этой процедуры. Таким образом, эта техника по сути представляет собой процесс взятия случайных подвыборок из предыдущих случайных выборок. Многоступенчатая выборка может существенно снизить затраты на выборку, особенно когда необходимо составить полный список популяции (прежде чем применять другие методы выборки). Исключение работы, связанной с описанием кластеров, которые не были отобраны, позволяет многоступенчатой выборке снизить высокие затраты, связанные с традиционным кластерным отбором. Целевую аудиторию для рекламы можно выбирать по характеристикам, таким как местоположение, возраст, пол, доход, профессия, образование или интересы, с помощью инструментов, предоставляемых социальной сетью. Реклама может содержать сообщение об исследовании и ссылку на опрос. После перехода по ссылке и заполнения опроса доброволец отправляет данные для включения в выборку. Этот метод может охватить глобальную аудиторию, но ограничен бюджетом кампании. В выборку могут быть включены и добровольцы, не входящие в приглашенную группу населения. Трудно делать обобщения на основе этой выборки, поскольку она может не представлять всю популяцию. Часто добровольцы проявляют большой интерес к основной теме опроса.
Отбор проб с пересечением линий
Метод линейных пересечений — это способ отбора проб элементов на определенной территории, при котором элемент регистрируется, если выбранный отрезок линии, называемый "трансектом", пересекает этот элемент.
Отбор проб в панели
Панельная выборка – это метод, при котором сначала отбирается группа участников с использованием метода случайной выборки, а затем у этой группы запрашивается (возможно, та же самая) информация несколько раз в течение определенного периода времени. Таким образом, каждый участник опрашивается в два или более моментов времени; каждый период сбора данных называется "волной". Метод был разработан социологом Полом Лазарсфельдом в 1938 году для изучения политических кампаний. Этот лонгитюдный метод выборки позволяет оценивать изменения в популяции, например, в отношении хронических заболеваний, стресса на работе или еженедельных расходов на продукты питания. Панельная выборка также может предоставлять исследователям информацию об изменениях здоровья внутри индивида, связанных с возрастом, или помогать объяснить изменения в непрерывных зависимых переменных, таких как супружеское взаимодействие. Существует несколько предложенных методов анализа панельных данных, включая MANOVA, модели роста и структурное моделирование уравнений с запаздывающими эффектами.
Снегоуборочная проба
Метод снежного кома предполагает поиск небольшой группы первоначальных респондентов и использование их для привлечения дополнительных респондентов. Он особенно полезен в тех случаях, когда целевая популяция скрыта или её сложно охватить при подсчете.
Теоретический отбор проб
Теоретическая выборка происходит, когда выбор образцов осуществляется на основе результатов анализа собранных данных с целью углубленного понимания исследуемой области или разработки теорий. Для повышения вероятности наблюдения явления могут отбираться крайние или очень специфические случаи.
Активный отбор проб
В активном отборе данных образцы, используемые для обучения алгоритма машинного обучения, выбираются целенаправленно. Также см. активное обучение (машинное обучение).
Замена выбранных единиц
Схемы выборки могут быть без возвращения ("WOR" – ни один элемент не может быть выбран более одного раза в одной и той же выборке) или с возвращением ("WR" – один и тот же элемент может появиться в выборке несколько раз). Например, если мы ловим рыбу, измеряем ее и сразу же возвращаем в воду, прежде чем продолжить отбор образца, это схема с возвращением (WR), поскольку мы можем поймать и измерить одну и ту же рыбу несколько раз. Однако, если мы не возвращаем рыбу в воду или метим и выпускаем каждую рыбу после поимки, это становится схемой без возвращения (WOR).
Применение метода выборки
Выборка позволяет отобрать релевантные точки данных из большего набора для оценки характеристик всей совокупности. Например, ежедневно генерируется около 600 миллионов твитов. Для определения тем, обсуждаемых в течение дня, нет необходимости анализировать все твиты, равно как и для определения тональности по каждой из этих тем. Разработана теоретическая основа для выборки данных Twitter. В производстве доступны различные типы сенсорных данных – акустические, вибрационные, данные о давлении, токе, напряжении и данные контроллеров – с короткими временными интервалами. Для прогнозирования времени простоя может быть достаточно анализа выборки, а не всех данных.
Ошибки в выборочных опросах
Результаты опроса обычно содержат определенную погрешность. Общая погрешность может быть классифицирована как ошибка выборки и невыборочные ошибки. Термин "ошибка" в данном случае включает в себя как систематические искажения, так и случайные ошибки.
Ошибки и искажения в выборе образцов
Ошибки и систематические погрешности выборки возникают из-за плана выборки. Они включают в себя:
Смещение отбора: когда фактические вероятности отбора отличаются от тех, которые используются при расчете результатов. Случайная ошибка выборки: случайные колебания результатов, обусловленные случайным отбором элементов в выборку.
Selection bias: When the true selection probabilities differ from those assumed in calculating the results. Random sampling error: Random variation in the results due to the elements in the sample being selected at random.
Веса опроса
Во многих ситуациях доля выборки может варьироваться в зависимости от страты, и данные необходимо взвешивать, чтобы корректно отражать генеральную совокупность. Например, простая случайная выборка населения Соединенного Королевства может не включать жителей отдаленных шотландских островов, выборка которых была бы неоправданно дорогой. Более экономичным методом было бы использование стратифицированной выборки с городскими и сельскими стратами. Сельская страта может быть недостаточно представлена в выборке, но в анализе это можно компенсировать соответствующими весами. В общем случае, данные следует взвешивать, если схема выборки не обеспечивает каждому индивиду равные шансы попасть в выборку. Например, если домохозяйства имеют равные вероятности отбора, но в каждом домохозяйстве опрашивается только один человек, то у жителей крупных домохозяйств меньше шансов быть опрошенными. Это можно учесть с помощью весов опроса. Аналогично, домохозяйства с несколькими телефонными линиями имеют более высокую вероятность быть отобранными при случайной выборке номеров, и веса могут быть использованы для корректировки этого. Веса также могут служить другим целям, например, для корректировки неполноты ответов.
ANSI, ASQ
ANSI/ASQ Z1.4