Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
В статистике гомогенность и её противоположность, гетерогенность, возникают при описании свойств набора данных или нескольких наборов данных. Они связаны с обоснованностью часто удобного предположения о том, что статистические характеристики любой части общего набора данных совпадают с характеристиками любой другой его части. В метаанализе, который объединяет данные нескольких исследований, гомогенность измеряет различия или сходства между этими исследованиями (см. также гетерогенность исследования). Гомогенность можно изучать на разных уровнях сложности. Например, рассмотрение гомоскедастичности исследует, насколько меняется разброс значений данных в пределах набора данных. Однако вопросы гомогенности применимы ко всем аспектам статистического распределения, включая параметр расположения. Таким образом, более детальное исследование будет изучать изменения в целом по предельному распределению. Исследование среднего уровня сложности может перейти от изучения разброса к изучению изменений в асимметрии. Помимо этого, вопросы гомогенности относятся и к совместным распределениям. Концепция гомогенности может применяться различными способами, и для определенных типов статистического анализа она используется для выявления дополнительных свойств, которые могут потребовать рассмотрения как изменяющихся в пределах набора данных после устранения некоторых первоначальных типов гетерогенности.
In statistics, homogeneity and its opposite, heterogeneity, arise in describing the properties of a dataset, or several datasets. They relate to the validity of the often convenient assumption that the statistical properties of any one part of an overall dataset are the same as any other part. In meta analysis, which combines the data from several studies, homogeneity measures the differences or similarities between the several studies (see also Study heterogeneity). Homogeneity can be studied to several degrees of complexity. For example, considerations of homoscedasticity examine how much the variability of data values changes throughout a dataset. However, questions of homogeneity apply to all aspects of the statistical distributions, including the location parameter. Thus, a more detailed study would examine changes to the whole of the marginal distribution. An intermediate level study might move from looking at the variability to studying changes in the skewness. In addition to these, questions of homogeneity apply also to the joint distributions. The concept of homogeneity can be applied in many different ways and, for certain types of statistical analysis, it is used to look for further properties that might need to be treated as varying within a dataset once some initial types of non homogeneity have been dealt with.
Регрессия
Различия в типичных значениях в наборе данных можно первоначально обработать, построив регрессионную модель с использованием определенных объясняющих переменных для установления связи между изменениями типичных значений и известными величинами. Далее необходимо провести отдельный этап анализа, чтобы проверить, ведут ли себя ошибки в прогнозах регрессии одинаково для всех данных. Таким образом, вопрос сводится к однородности распределения остатков при изменении объясняющих переменных. См. регрессионный анализ.
Differences in the typical values across the dataset might initially be dealt with by constructing a regression model using certain explanatory variables to relate variations in the typical value to known quantities. There should then be a later stage of analysis to examine whether the errors in the predictions from the regression behave in the same way across the dataset. Thus the question becomes one of the homogeneity of the distribution of the residuals, as the explanatory variables change. See regression analysis.
Временные ряды
Начальные этапы анализа временного ряда могут включать построение графика значений во времени для оценки однородности ряда различными способами: стабильность во времени по сравнению с трендом; стабильность локальных колебаний во времени.
The initial stages in the analysis of a time series may involve plotting values against time to examine homogeneity of the series in various ways: stability across time as opposed to a trend; stability of local fluctuations over time.
Объединение информации между сайтами
В гидрологии анализируются ряды данных по нескольким пунктам наблюдений, состоящие из годовых значений максимального расхода воды в реке за год. Распространенная модель предполагает, что распределения этих значений одинаковы для всех пунктов, за исключением простого коэффициента масштабирования, таким образом, параметры расположения и масштаба связаны простым соотношением. В дальнейшем может возникнуть необходимость в исследовании однородности распределений масштабированных значений по всем пунктам наблюдений.
In hydrology, data series across a number of sites composed of annual values of the within year annual maximum river flow are analysed. A common model is that the distributions of these values are the same for all sites apart from a simple scaling factor, so that the location and scale are linked in a simple way. There can then be questions of examining the homogeneity across sites of the distribution of the scaled values.
Объединение источников информации
В метеорологии данные о погоде накапливаются в течение многих лет наблюдений, и в процессе этого измерения на определенных станциях могут временно прекращаться, в то время как примерно в то же время измерения могут начинаться на расположенных поблизости пунктах. В связи с этим возникает вопрос, можно ли считать объединенный, более длительный ряд наблюдений однородным во времени. Пример проверки однородности данных о скорости и направлении ветра приведен в работе Romanić et al., 2015.
In meteorology, weather datasets are acquired over many years of record and, as part of this, measurements at certain stations may cease occasionally while, at around the same time, measurements may start at nearby locations. There are then questions as to whether, if the records are combined to form a single longer set of records, those records can be considered homogeneous over time. An example of homogeneity testing of wind speed and direction data can be found in Romanić et al., 2015.
Однородность внутри популяций
Простые обследования населения могут исходить из предположения, что ответы будут однородными во всей популяции. Оценка однородности популяции подразумевает проверку того, различаются ли ответы определенных выделяемых подпопуляций по сравнению с ответами других. Например, владельцы автомобилей могут отличаться от невладельцев, или могут существовать различия между разными возрастными группами.
Simple populations surveys may start from the idea that responses will be homogeneous across the whole of a population. Assessing the homogeneity of the population would involve looking to see whether the responses of certain identifiable subpopulations differ from those of others. For example, car owners may differ from non car owners, or there may be differences between different age groups.
Испытания
Испытание на однородность, в смысле точного совпадения статистических распределений, может быть основано на статистике E. Тест на местоположение проверяет более простую гипотезу о том, что распределения имеют одинаковый параметр местоположения.
A test for homogeneity, in the sense of exact equivalence of statistical distributions, can be based on an E statistic. A location test tests the simpler hypothesis that distributions have the same location parameter.