Разложение суммы квадратов: основа статистического анализа
Partition of sums of squares
Разложение суммы квадратов: ключевая концепция в статистике. Описывает дисперсию данных, выявляет источники изменчивости и оценивает значимость факторов.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Понятие, пронизывающее большую часть инференциальной и описательной статистики.
Concept that permeates much of inferential statistics and descriptive statistics
Разложение суммы квадратов – это понятие, пронизывающее большую часть инференциальной и описательной статистики. Более точно, это разделение суммы квадратов отклонений или ошибок. Математически, сумма квадратов отклонений является ненормированной, или не скорректированной мерой разброса (также называемой изменчивостью). При масштабировании по числу степеней свободы она оценивает дисперсию, или степень рассеяния наблюдений относительно их среднего значения. Разделение суммы квадратов отклонений на различные компоненты позволяет отнести общую изменчивость в наборе данных к различным типам или источникам изменчивости, при этом относительная значимость каждого из них количественно определяется размером соответствующего компонента общей суммы квадратов.
The partition of sums of squares is a concept that permeates much of inferential statistics and descriptive statistics. More properly, it is the partitioning of sums of squared deviations or errors. Mathematically, the sum of squared deviations is an unscaled, or unadjusted measure of dispersion (also called variability). When scaled for the number of degrees of freedom, it estimates the variance, or spread of the observations about their mean value. Partitioning of the sum of squared deviations into various components allows the overall variability in a dataset to be ascribed to different types or sources of variability, with the relative importance of each being quantified by the size of each component of the overall sum of squares.
Предыстория
Расстояние от любой точки в наборе данных до среднего значения данных является отклонением. Это можно записать как , где – i-я точка данных, а – оценка среднего значения. Если все такие отклонения возвести в квадрат и затем просуммировать, как в , то получится "сумма квадратов" для этих данных. При добавлении новых данных в коллекцию сумма квадратов обычно увеличивается, за исключением маловероятных случаев, когда новые данные равны среднему значению. Таким образом, сумма квадратов растет с увеличением размера набора данных, что является проявлением ее ненормированности. Во многих случаях число степеней свободы равно числу точек данных в коллекции минус один. Это записывается как n – 1, где n – количество точек данных. Масштабирование (также известное как нормализация) означает корректировку суммы квадратов таким образом, чтобы она не увеличивалась с ростом размера набора данных. Это важно при сравнении выборок разного размера, например, выборки из 100 человек с выборкой из 20 человек. Если бы сумма квадратов не была нормализована, ее значение всегда было бы больше для выборки из 100 человек, чем для выборки из 20 человек. Чтобы масштабировать сумму квадратов, ее делят на число степеней свободы, то есть вычисляют сумму квадратов на степень свободы, или дисперсию. Стандартное отклонение, в свою очередь, является квадратным корнем дисперсии. Описанное выше относится к использованию суммы квадратов в описательной статистике; подробнее о применении этого общего принципа в инференциальной статистике можно узнать в статье о полной сумме квадратов.
The distance from any point in a collection of data, to the mean of the data, is the deviation. This can be written as , where is the ith data point, and is the estimate of the mean. If all such deviations are squared, then summed, as in , this gives the "sum of squares" for these data. When more data are added to the collection the sum of squares will increase, except in unlikely cases such as the new data being equal to the mean. So usually, the sum of squares will grow with the size of the data collection. That is a manifestation of the fact that it is unscaled. In many cases, the number of degrees of freedom is simply the number of data points in the collection, minus one. We write this as n − 1, where n is the number of data points. Scaling (also known as normalizing) means adjusting the sum of squares so that it does not grow as the size of the data collection grows. This is important when we want to compare samples of different sizes, such as a sample of 100 people compared to a sample of 20 people. If the sum of squares were not normalized, its value would always be larger for the sample of 100 people than for the sample of 20 people. To scale the sum of squares, we divide it by the degrees of freedom, i. e., calculate the sum of squares per degree of freedom, or variance. Standard deviation, in turn, is the square root of the variance. The above describes how the sum of squares is used in descriptive statistics; see the article on total sum of squares for an application of this broad principle to inferential statistics.
Дальнейшее разделение
Обратите внимание, что остаточная сумма квадратов может быть дополнительно разделена на сумму квадратов расхождения и сумму квадратов, обусловленную случайной ошибкой.
Note that the residual sum of squares can be further partitioned as the lack of fit sum of squares plus the sum of squares due to pure error.