Введение

Полный набор элементов, имеющих хотя бы одно общее свойство, или численность людей. В статистике, популяция – это совокупность схожих элементов или событий, представляющих интерес для определенного вопроса или эксперимента. Статистическая популяция может быть группой существующих объектов (например, множество всех звезд в галактике Млечный Путь) или гипотетической и потенциально бесконечной группой объектов, представляющей собой обобщение, основанное на опыте (например, множество всех возможных комбинаций карт в игре в покер). Распространенная цель статистического анализа – получение информации об определенной популяции. В статистическом выводе, подмножество популяции (статистическая выборка) выбирается для представления популяции в статистическом анализе. При этом статистическая выборка должна быть непредвзятой и точно отражать характеристики популяции (каждый элемент популяции должен иметь равные шансы быть отобранным). Отношение размера статистической выборки к размеру популяции называется долей выборки. Затем можно оценить параметры популяции, используя соответствующие статистические показатели выборки.

Сквернословие

Среднее значение генеральной совокупности, или математическое ожидание, является мерой центральной тенденции распределения вероятностей или случайной величины, описываемой этим распределением. В дискретном распределении вероятностей случайной величины X среднее значение равно сумме всех возможных значений, взвешенных вероятностью каждого значения; то есть, оно вычисляется как произведение каждого возможного значения x величины X на его вероятность p(x), с последующим суммированием всех этих произведений. Аналогичная формула применима и к случаю непрерывного распределения вероятностей. Не каждое распределение вероятностей имеет определенное среднее значение (например, распределение Коши). Более того, среднее значение может быть бесконечным для некоторых распределений. Для конечной генеральной совокупности среднее значение свойства равно среднему арифметическому этого свойства, рассчитанному по всем элементам генеральной совокупности. Например, средний рост населения равен сумме ростов всех индивидуумов, деленной на общее число индивидуумов. Среднее значение выборки может отличаться от среднего значения генеральной совокупности, особенно при небольшом размере выборки. Закон больших чисел утверждает, что чем больше размер выборки, тем выше вероятность того, что среднее значение выборки будет близко к среднему значению генеральной совокупности.

Подсообщество

Подмножество популяции, обладающее одним или несколькими дополнительными свойствами, называется подпопуляцией. Например, если популяция – все египтяне, то подпопуляцией будут все египетские мужчины; если популяция – все аптеки мира, то подпопуляцией будут все аптеки в Египте. В отличие от этого, выборка – это подмножество популяции, которое не отбирается по какому-либо дополнительному признаку. Дескриптивная статистика может давать различные результаты для разных подпопуляций. Например, определенное лекарство может по-разному воздействовать на различные подпопуляции, и эти эффекты могут быть замаскированы или проигнорированы, если такие специфические подпопуляции не идентифицированы и не исследованы отдельно. Аналогично, часто можно более точно оценить параметры, если выделить подпопуляции: например, распределение роста среди людей лучше моделируется, если рассматривать мужчин и женщин как отдельные подпопуляции. Популяции, состоящие из подпопуляций, могут быть смоделированы с помощью смешанных моделей, которые объединяют распределения внутри подпопуляций в общее распределение популяции. Даже если подпопуляции хорошо описываются простыми моделями, общая популяция может плохо соответствовать этой простой модели – плохое соответствие может свидетельствовать о существовании подпопуляций. Например, если две равные подпопуляции имеют нормальное распределение, одинаковое стандартное отклонение, но разные средние значения, то общее распределение будет иметь низкий эксцесс по сравнению с единым нормальным распределением – средние значения подпопуляций будут приходиться на «плечи» общего распределения. Если они достаточно разнесены, они образуют бимодальное распределение; в противном случае, оно просто имеет широкий пик. Кроме того, оно будет демонстрировать избыточную дисперсию по сравнению с единым нормальным распределением с заданной дисперсией. В качестве альтернативы, если две подпопуляции имеют одинаковое среднее значение, но разное стандартное отклонение, то общая популяция будет демонстрировать высокий эксцесс, с более острым пиком и более тяжелыми хвостами (и, соответственно, более пологими «плечами»), чем единое распределение.