Введение
Методология выборки в статистике
В статистике кластерная выборка – это план выборки, используемый, когда в статистической совокупности явно выделяются взаимооднородные, но внутренне неоднородные группировки. Она часто применяется в маркетинговых исследованиях. В рамках этого плана выборки вся совокупность разделяется на эти группы (известные как кластеры), и из этих групп выбирается простая случайная выборка. Затем внутри каждого кластера производится отбор элементов. Если все элементы каждого отобранного кластера подвергаются отбору, то такой план называется "одноступенчатой" кластерной выборкой. Если внутри каждой из этих групп выбирается простая случайная подвыборка элементов, то это называется "двухступенчатой" кластерной выборкой. Основной причиной использования кластерной выборки является снижение общего числа интервью и затрат при сохранении необходимой точности. При фиксированном объеме выборки ожидаемая случайная ошибка будет меньше, если большая часть изменчивости в совокупности сосредоточена внутри групп, а не между ними.
Кластер элементарный
В идеале, популяция внутри кластера должна быть максимально разнородной, но между кластерами – однородной. Каждый кластер должен являться уменьшенной копией генеральной совокупности. Кластеры должны быть взаимоисключающими и в совокупности представлять всю генеральную совокупность. Далее применяется метод случайного отбора для выбора релевантных кластеров, которые будут включены в исследование. При одноступенчатой кластерной выборке отбираются все элементы из каждого выбранного кластера. При двухступенчатой кластерной выборке метод случайного отбора применяется к элементам внутри каждого выбранного кластера. Основное отличие между кластерной и стратифицированной выборкой заключается в том, что при кластерной выборке кластер рассматривается как единица выборки, поэтому выборка производится по совокупности кластеров (по крайней мере, на первом этапе). При стратифицированной выборке выборка производится по элементам внутри каждой страты. В стратифицированной выборке из каждой страты формируется случайная выборка, в то время как при кластерной выборке отбираются только выбранные кластеры. Распространенная причина использования кластерной выборки – снижение затрат за счет повышения эффективности выборки. Это противопоставляется стратифицированной выборке, где целью является повышение точности. Существует также многоступенчатая кластерная выборка, при которой для отбора элементов из кластеров используется как минимум два этапа.
Когда кластеры разного размера
Без изменения оцениваемого параметра, кластерная выборка является несмещенной, когда кластеры приблизительно одинаковы по размеру. В этом случае параметр вычисляется путем объединения всех отобранных кластеров. Если кластеры различаются по размеру, существует несколько подходов:
Один из методов – выборка кластеров с последующим опросом всех элементов внутри каждого выбранного кластера. Другой метод – двухступенчатая выборка фиксированной доли элементов (например, 5% или 50%, или иное значение, в зависимости от соображений стоимости) из каждого из отобранных кластеров. Использование выборки, полученной одним из этих способов, позволяет получить несмещенную оценку. Однако размер выборки больше не фиксирован заранее. Это приводит к более сложной формуле для вычисления стандартной ошибки оценки, а также к проблемам с представлением плана исследования (поскольку анализ мощности и оценка стоимости часто привязаны к конкретному размеру выборки). Третье возможное решение – использование вероятностной выборки пропорционально размеру. В этом плане выборки вероятность выбора кластера пропорциональна его размеру, то есть большой кластер имеет более высокую вероятность быть выбранным, чем маленький. Преимущество заключается в том, что при выборе кластеров с вероятностью, пропорциональной их размеру, следует проводить одинаковое количество интервью в каждом отобранном кластере, чтобы каждая выбранная единица имела одинаковую вероятность попадания в выборку.
Применение кластерного отбора проб
Примером кластерной выборки является выборка по территории или географическая кластерная выборка. Каждый кластер представляет собой географическую область в рамках выборки по территории. Поскольку обследование географически рассредоточенного населения может быть дорогостоящим, большей экономии, чем при простой случайной выборке, можно достичь, объединив нескольких респондентов в пределах локальной территории в кластер. Обычно необходимо увеличить общий размер выборки для достижения сопоставимой точности оценок, но экономия средств может сделать такое увеличение размера выборки целесообразным. При организации переписи населения первым шагом обычно является разделение общей географической области на переписные участки или районы для организации полевых работ. Переписные участки также могут быть полезны в качестве первичных единиц для кластерной выборки во многих типах обследований. Если перепись населения устарела, список лиц не следует напрямую использовать в качестве базы выборки для социально-экономического обследования. Обновление всей переписи экономически нецелесообразно. Хорошей альтернативой может быть сохранение старых переписных участков с частичным обновлением в быстро меняющихся районах, таких как городские пригороды, выборка переписных участков и обновление списков лиц или домохозяйств только в отобранных участках. Кластерная выборка используется для оценки низкой смертности в таких ситуациях, как войны, голод и стихийные бедствия.
Наука о рыболовстве
Почти невозможно получить простую случайную выборку рыбы из популяции, что потребовало бы отлова отдельных особей случайным образом. Это происходит потому, что рыболовные снасти ловят рыбу группами (или кластерами). В коммерческом рыболовстве затраты на работу в море часто слишком высоки, чтобы отбирать отдельные уловы случайным образом. Следовательно, наблюдения дополнительно группируются по судам или по рыболовным рейсам.
Преимущества
Может быть дешевле, чем другие планы выборки – например, меньше расходов на командировки и административные издержки. Осуществимость: этот план выборки подходит для больших популяций. Поскольку эти группы относительно небольшие, применение любого другого плана выборки было бы очень затратным. Экономичность: в этом методе значительно снижаются две основные статьи расходов – командировки и составление списков. Например, сбор информации о каждом домохозяйстве в городе был бы очень дорогим, в то время как сбор информации по различным участкам города будет более экономичным. В этом случае значительно сократятся как расходы на командировки, так и усилия по составлению списков. Снижение вариативности: в редком случае отрицательной внутрикластерной корреляции между объектами внутри кластера, оценки, полученные при кластерной выборке, будут более точными, чем оценки, полученные при простой случайной выборке (то есть эффект дизайна будет больше 1). Это нетипичная ситуация. Основное применение: кластерная выборка – единственный возможный вариант, когда отсутствует полный перечень элементов генеральной совокупности.
Недостатки
Более высокая погрешность выборки, которую можно выразить эффектом дизайна: это отношение дисперсии оценщика, полученного на основе выборки кластерного исследования, к дисперсии оценщика, полученного на основе выборки в равноценном, случайно отобранном некластерном исследовании. Чем выше внутриклассовая корреляция между участниками внутри кластера, тем хуже становится эффект дизайна (то есть тем больше он отклоняется от 1, что указывает на ожидаемое большее увеличение дисперсии оценщика). Иными словами, чем больше неоднородность между кластерами и однородность внутри кластеров, тем менее точными становятся наши оценки. Это происходит потому, что в таких случаях предпочтительнее отбирать как можно больше кластеров, ограничиваясь небольшой выборкой участников внутри каждого кластера (то есть использовать двухступенчатую кластерную выборку). Сложность. Кластерная выборка более сложна и требует тщательного планирования и анализа (например, необходимо учитывать веса участников при оценке параметров и доверительных интервалов).
Двухступенчатый кластерный отбор проб
Двухступенчатая кластерная выборка, являющаяся простым случаем многоступенчатой выборки, осуществляется путем отбора кластерных выборок на первом этапе и последующего отбора элементов из каждого отобранного кластера. Рассмотрим популяцию, состоящую из N кластеров. На первом этапе с использованием обычной кластерной выборки отбирается n кластеров. На втором этапе обычно применяется простая случайная выборка, которая проводится независимо в каждом кластере, и количество элементов, отобранных из разных кластеров, не обязательно должно быть одинаковым. Общее количество кластеров N, количество отобранных кластеров n и количество элементов из отобранных кластеров должны быть заранее определены исследователем. Двухступенчатая кластерная выборка направлена на минимизацию затрат на исследование и одновременный контроль неопределенности, связанной с оцениваемыми показателями. Этот метод может применяться в здравоохранении и социальных науках. Например, исследователи использовали двухступенчатую кластерную выборку для формирования репрезентативной выборки населения Ирака с целью проведения исследований смертности. Выборка, полученная этим методом, может быть более быстрой и надежной, чем при использовании других методов, что объясняет ее широкое распространение.
Вывод, когда количество кластеров мало
Методы кластерного отбора проб могут приводить к значительным искажениям при работе с небольшим числом кластеров. Например, может потребоваться кластеризация на уровне штата или города, где количество единиц может быть небольшим и фиксированным. Методы микроэконометрики для панельных данных часто используют короткие панели, что аналогично небольшому числу наблюдений в кластере и большому числу кластеров. Проблема малого числа кластеров может рассматриваться как проблема побочных параметров. Хотя точечные оценки могут быть достаточно точно оценены при достаточно большом числе наблюдений в кластере, для достижения асимптотических свойств необходимо достаточное число кластеров. Если число кластеров мало, оценка ковариационной матрицы может быть занижена. Небольшое число кластеров представляет риск при наличии серийной корреляции или внутриклассовой корреляции, как в контексте Моултона. При малом числе кластеров мы склонны недооценивать серийную корреляцию между наблюдениями при случайном шоке или внутриклассовую корреляцию в условиях Моултона. Ряд исследований выявили последствия серийной корреляции и подчеркнули проблему малого числа кластеров. В рамках множителя Моултона интуитивное объяснение проблемы малого числа кластеров можно вывести из формулы для множителя Моултона. Для простоты предположим, что число наблюдений в кластере фиксировано и равно n. Ниже обозначает ковариационную матрицу, скорректированную с учетом кластеризации, – ковариационную матрицу без корректировки на кластеризацию, а ρ – внутриклассовую корреляцию:
Соотношение слева показывает, насколько не скорректированный вариант переоценивает точность. Следовательно, высокое значение указывает на сильное занижение оценочной ковариационной матрицы. Проблему малого числа кластеров можно интерпретировать как большое n: когда данные фиксированы, а число кластеров мало, число данных внутри кластера может быть большим. Отсюда следует, что при малом числе кластеров выводы не будут иметь корректного уровня охвата.