Введение
Сбор статистических моделей
Анализ дисперсии (ANOVA) — это набор статистических моделей и связанных с ними процедур оценки (таких как оценка "разброса" внутри и между группами), используемых для анализа различий между средними значениями. ANOVA был разработан статистиком Рональдом Фишером. ANOVA основана на законе полной дисперсии, согласно которому наблюдаемая дисперсия в конкретной переменной разделяется на компоненты, обусловленные различными источниками вариации. В простейшем виде ANOVA предоставляет статистический тест для проверки равенства двух или более средних генеральной совокупности и, таким образом, обобщает t-тест для случая более двух средних значений. Иными словами, ANOVA используется для проверки различий между двумя или более средними значениями.
История
В то время как анализ дисперсии достиг своего расцвета в 20 веке, его истоки уходят вглубь веков, согласно Стиглеру. К ним относятся проверка гипотез, разбиение суммы квадратов, экспериментальные методы и аддитивная модель. Лаплас проводил проверку гипотез в 1770-х годах. Около 1800 года Лаплас и Гаусс разработали метод наименьших квадратов для объединения наблюдений, который усовершенствовал методы, использовавшиеся в астрономии и геодезии. Это также стимулировало множество исследований вклада в сумму квадратов. Лаплас умел оценивать дисперсию на основе остаточной (а не общей) суммы квадратов. К 1827 году Лаплас использовал метод наименьших квадратов для решения задач дисперсионного анализа, касающихся измерений атмосферных приливов. До 1800 года астрономы выделили ошибки наблюдений, вызванные временем реакции («личное уравнение»), и разработали методы их уменьшения. Экспериментальные методы, использованные при изучении «личного уравнения», впоследствии были приняты развивающейся областью психологии, которая разработала строгие (полнофакторные) экспериментальные методы, к которым вскоре были добавлены рандомизация и маскирование. В 1885 году было доступно убедительное не математическое объяснение аддитивной модели. Рональд Фишер ввел термин «дисперсия» и предложил ее формальный анализ в статье 1918 года по теоретической популяционной генетике «Корреляция между родственниками при условии менделевского наследования». Его первое применение дисперсионного анализа к анализу данных было опубликовано в 1921 году в «Исследованиях изменчивости сельскохозяйственных культур I», где изменчивость временного ряда была разделена на компоненты, представляющие собой годовые причины и медленное ухудшение. Следующая работа Фишера, «Исследования изменчивости сельскохозяйственных культур II», написанная совместно с Винифред Маккензи и опубликованная в 1923 году, изучала изменчивость урожайности на участках, засеянных различными сортами и подвергавшихся различным методам внесения удобрений. Дисперсионный анализ получил широкое распространение после включения в книгу Фишера 1925 года «Статистические методы для научных работников». Модели рандомизации были разработаны несколькими исследователями. Первая из них была опубликована на польском языке Ежи Нейманом в 1923 году.
from reaction times (the "personal equation") and had developed methods of reducing the errors. The experimental methods used in the study of the personal equation were later accepted by the emerging field of psychology which developed strong (full factorial) experimental methods to which randomization and blinding were soon added. An eloquent non mathematical explanation of the additive effects model was available in 1885. Ronald Fisher introduced the term variance and proposed its formal analysis in a 1918 article on theoretical population genetics,The Correlation Between Relatives on the Supposition of Mendelian Inheritance. His first application of the analysis of variance to data analysis was published in 1921, Studies in Crop Variation I, This divided the variation of a time series into components representing annual causes and slow deterioration. Fisher's next piece, Studies in Crop Variation II, written with Winifred Mackenzie and published in 1923, studied the variation in yield across plots sown with different varieties and subjected to different fertiliser treatments. Analysis of variance became widely known after being included in Fisher's 1925 book Statistical Methods for Research Workers. Randomization models were developed by several researchers. The first was published in Polish by Jerzy Neyman in 1923.
Пример
Анализ дисперсии может быть использован для описания сложных взаимосвязей между переменными. В качестве примера можно привести выставку собак. Выставка собак – это не случайная выборка породы: обычно она ограничена взрослыми, породистыми и выдающимися собаками. Гистограмма веса собак с выставки может оказаться довольно сложной, как, например, желто-оранжевое распределение, показанное на иллюстрациях. Предположим, мы хотим предсказать вес собаки, основываясь на определенном наборе характеристик каждой собаки. Один из способов сделать это – объяснить распределение веса, разделив популяцию собак на группы на основе этих характеристик. Успешная группировка должна разделить собак таким образом, чтобы (а) каждая группа имела низкую дисперсию веса (то есть группа была относительно однородной) и (b) среднее значение каждой группы было различным (если две группы имеют одинаковое среднее значение, то нет оснований полагать, что группы действительно разделены каким-либо значимым образом). На иллюстрациях справа группы обозначены как X1, X2 и т. д. На первом примере собаки разделены по произведению (взаимодействию) двух бинарных признаков: молодые против старых и короткошерстные против длинношерстных (например, группа 1 – молодые, короткошерстные собаки, группа 2 – молодые, длинношерстные собаки и т. д.). Поскольку распределение веса собак в каждой из групп (показано синим цветом) имеет относительно большое разброс, и поскольку средние значения очень близки между группами, группировка собак по этим признакам не дает эффективного способа объяснить изменчивость веса собак: знание того, в какой группе находится собака, не позволяет нам предсказать ее вес намного лучше, чем просто знание того, что собака участвует в выставке. Таким образом, эта группировка не позволяет объяснить изменчивость в общем распределении (желто-оранжевом). Попытка объяснить распределение веса, группируя собак как домашних питомцев против рабочих пород и менее атлетичных против более атлетичных, вероятно, будет несколько более успешной (удовлетворительное соответствие). Самые тяжелые выставочные собаки, скорее всего, будут крупными, сильными, рабочими породами, в то время как породы, содержащиеся в качестве домашних питомцев, как правило, меньше и, следовательно, легче. Как показано на втором рисунке, распределения имеют значительно меньший разброс, чем в первом случае, и средние значения более различимы. Однако значительное перекрытие распределений, например, означает, что мы не можем надежно различать X1 и X2. Группировка собак случайным образом, например, подбрасыванием монеты, может привести к аналогичным распределениям. Попытка объяснить вес по породе, вероятно, приведет к очень хорошему соответствию. Все чихуахуа легкие, а все сенбернары тяжелые. Разница в весе между сеттерами и пойнтерами не оправдывает выделение отдельных пород. Анализ дисперсии предоставляет формальные инструменты для обоснования этих интуитивных суждений. Распространенное применение метода – анализ экспериментальных данных или разработка моделей. Метод имеет некоторые преимущества перед корреляцией: не все данные должны быть числовыми, и одним из результатов метода является оценка достоверности объясняющей связи.
Классы моделей
Существует три класса моделей, используемых при анализе дисперсии, которые представлены ниже.
Модели с фиксированным эффектом
Модель с фиксированными эффектами (класс I) дисперсионного анализа применяется в ситуациях, когда экспериментатор воздействует одним или несколькими факторами на объекты исследования, чтобы определить, изменяются ли значения признака отклика. Это позволяет экспериментатору оценить диапазон значений признака отклика, который эти факторы вызвали бы в генеральной совокупности.
Модели случайных эффектов
Модель случайных эффектов (класс II) используется, когда факторы не являются фиксированными. Это происходит, когда различные уровни факторов выбираются из генеральной совокупности. Поскольку сами уровни являются случайными величинами, некоторые предположения и метод сопоставления вариантов лечения (многомерное обобщение простых разностей) отличаются от модели фиксированных эффектов.
Модели смешанного эффекта
Модель смешанных эффектов (класс III) включает в себя экспериментальные факторы двух типов: фиксированные и случайные, каждый из которых требует своей интерпретации и методов анализа.
Пример
Учебные эксперименты могут быть проведены кафедрой колледжа или университета для поиска подходящего вводного учебника, при этом каждый учебник рассматривается как вариант воздействия. Модель фиксированных эффектов сравнит список учебников-кандидатов. Модель случайных эффектов позволит определить, существуют ли значимые различия между списком случайно выбранных учебников. Модель смешанных эффектов сравнит (фиксированные) используемые учебники с случайно выбранными альтернативами. Определение фиксированных и случайных эффектов оказалось сложной задачей, существует множество конкурирующих определений.
Предположения
Анализ дисперсии изучался с различных точек зрения, наиболее распространенной из которых является использование линейной модели, связывающей зависимую переменную с факторами и блоками. Важно отметить, что модель линейна по параметрам, но может быть нелинейной в зависимости от уровней факторов. Интерпретация результатов упрощается при сбалансированном дизайне эксперимента, однако для несбалансированных данных требуется более глубокое понимание.
Анализ на основе рандомизации
В рандомизированном контролируемом эксперименте воздействия случайным образом назначаются экспериментальным единицам в соответствии с экспериментальным протоколом. Эта рандомизация является объективной и декларируется до начала эксперимента. Объективное случайное назначение используется для проверки значимости нулевой гипотезы, основываясь на идеях Ч. С. Пирса и Рональда Фишера. Этот подход, основанный на дизайне эксперимента, обсуждался и разрабатывался Фрэнсисом Дж. Анскомбом на экспериментальной станции Ротамстед и Оскаром Кемпторном в Университете штата Айова. Кемпторн и его ученики исходят из предположения об аддитивности эффектов воздействия, которое рассматривается в книгах Кемпторна и Дэвида Р. Кокса.
Выведенная линейная модель
Кемпторн использует распределение рандомизации и предположение об аддитивности эффектов лечения для получения производной линейной модели, очень похожей на модель, описанную в учебниках, которую мы обсуждали ранее. Статистики тестов этой производной линейной модели хорошо приближаются статистиками тестов соответствующей нормальной линейной модели, согласно теоремам аппроксимации и результатам моделирования. Однако существуют и различия. Например, анализ, основанный на рандомизации, приводит к небольшой, но (строго) отрицательной корреляции между наблюдениями. В анализе, основанном на рандомизации, не делается предположение о нормальном распределении и, тем более, о независимости. Напротив, наблюдения зависимы! Анализ на основе рандомизации имеет недостаток в том, что его изложение требует сложных алгебраических выкладок и занимает много времени. Поскольку анализ на основе рандомизации сложен и хорошо приближается подходом с использованием нормальной линейной модели, большинство преподавателей делают акцент на подходе нормальной линейной модели. Лишь немногие статистики возражают против анализа сбалансированных рандомизированных экспериментов на основе модели.
Статистические модели для данных наблюдений
Однако при применении к данным нерандомизированных экспериментов или обсервационных исследований, анализ на основе моделей лишается обоснованности, обеспечиваемой рандомизацией. Для обсервационных данных, построение доверительных интервалов требует использования субъективных моделей, что подчеркивали Рональд Фишер и его сторонники. На практике, оценки эффекта лечения, полученные из обсервационных исследований, как правило, часто бывают несостоятельными. На практике, "статистические модели" и обсервационные данные полезны для формулирования гипотез, к которым общественность должна относиться с большой осторожностью.
Резюме допущений
Анализ ANOVA, основанный на нормальной модели, предполагает независимость, нормальность и однородность дисперсий остатков. Анализ, основанный на рандомизации, предполагает только однородность дисперсий остатков (как следствие аддитивности эффектов отдельных экспериментальных единиц) и использует процедуру рандомизации эксперимента. Оба этих анализа требуют гомоскедастичности, как предположения для анализа нормальной модели, так и как следствия рандомизации и аддитивности для анализа, основанного на рандомизации. Однако исследования процессов, изменяющих дисперсии, а не средние значения (так называемые эффекты дисперсии), успешно проводились с использованием ANOVA. Для ANOVA в общем случае не существует строгих предположений, но F-тест, используемый для проверки гипотез ANOVA, имеет предположения и практические ограничения, представляющие постоянный интерес. Проблемы, не удовлетворяющие предположениям ANOVA, часто можно преобразовать для их соблюдения. Свойство аддитивности эффектов отдельных экспериментальных единиц не инвариантно при "изменении масштаба", поэтому статистики часто используют преобразования для достижения аддитивности. Если переменная отклика, как ожидается, подчиняется параметрическому семейству распределений вероятностей, то статистик может указать (в протоколе эксперимента или наблюдательного исследования), что отклики должны быть преобразованы для стабилизации дисперсии. Также статистик может указать применение логарифмических преобразований к откликам, которые, как предполагается, подчиняются мультипликативной модели. Согласно теореме функционального уравнения Коши, логарифм – единственное непрерывное преобразование, преобразующее реальное умножение в сложение.
limitations which are of continuing interest. Problems which do not satisfy the assumptions of ANOVA can often be transformed to satisfy the assumptions. The property of unit treatment additivity is not invariant under a "change of scale", so statisticians often use transformations to achieve unit treatment additivity. If the response variable is expected to follow a parametric family of probability distributions, then the statistician may specify (in the protocol for the experiment or observational study) that the responses be transformed to stabilize the variance. Also, a statistician may specify that logarithmic transforms be applied to the responses which are believed to follow a multiplicative model. According to Cauchy's functional equation theorem, the logarithm is the only continuous transformation that transforms real multiplication to addition.
Характеристики
ANOVA используется при анализе сравнительных экспериментов, в которых важна только разница в результатах. Статистическая значимость эксперимента определяется отношением двух дисперсий. Это отношение не зависит от ряда возможных изменений экспериментальных данных: добавление константы ко всем наблюдениям не влияет на значимость. Умножение всех наблюдений на константу также не влияет на значимость. Таким образом, результат статистической значимости ANOVA не зависит от систематической погрешности и ошибок масштабирования, а также от единиц измерения, используемых для представления наблюдений. В эпоху механических вычислений было принято вычитать константу из всех наблюдений (что эквивалентно отбрасыванию старших разрядов), чтобы упростить ввод данных. Это пример кодирования данных.
Алгоритм
Расчеты ANOVA можно охарактеризовать как вычисление нескольких средних и дисперсий, деление одной дисперсии на другую и сравнение полученного отношения с табличным значением для определения статистической значимости. Вычисление эффекта воздействия (или эффекта обработки) затем является тривиальной задачей: "эффект любого воздействия оценивается как разность между средним значением наблюдений, подвергшихся воздействию, и общим средним значением".
Разделение суммы квадратов
ANOVA использует традиционную стандартизированную терминологию. Определение уравнения дисперсии выборки: , где делитель называется степенями свободы (DF), сумма – суммой квадратов (SS), результат – средним квадратом (MS), а возведенные в квадрат члены – отклонениями от среднего значения выборки. ANOVA оценивает 3 дисперсии выборки: общую дисперсию, основанную на всех отклонениях наблюдений от генеральной средней, дисперсию ошибок, основанную на всех отклонениях наблюдений от соответствующих средних значений для каждой группы, и дисперсию групп. Дисперсия групп основана на отклонениях средних значений групп от генеральной средней, при этом результат умножается на количество наблюдений в каждой группе, чтобы учесть разницу между дисперсией наблюдений и дисперсией средних значений. Фундаментальная техника заключается в разложении общей суммы квадратов SS на компоненты, связанные с эффектами, используемыми в модели. Например, модель для упрощенного ANOVA с одним типом воздействия на разных уровнях. Степени свободы DF также могут быть разложены аналогичным образом: одна из этих составляющих (для ошибок) определяет распределение хи-квадрат, которое описывает соответствующую сумму квадратов, и то же самое верно для "групп", если эффекта воздействия нет.
the sum of squares (SS), the result is called the mean square (MS) and the squared terms are deviations from the sample mean. ANOVA estimates 3 sample variances: a total variance based on all the observation deviations from the grand mean, an error variance based on all the observation deviations from their appropriate treatment means, and a treatment variance. The treatment variance is based on the deviations of treatment means from the grand mean, the result being multiplied by the number of observations in each treatment to account for the difference between the variance of observations and the variance of means. The fundamental technique is a partitioning of the total sum of squares SS into components related to the effects used in the model. For example, the model for a simplified ANOVA with one type of treatment at different levels. The number of degrees of freedom DF can be partitioned in a similar way: one of these components (that for error) specifies a chi squared distribution which describes the associated sum of squares, while the same is true for "treatments" if there is no treatment effect.
Расширенный алгоритм
ANOVA состоит из отдельных компонентов; разделение источников дисперсии и проверка гипотез могут использоваться независимо друг от друга. ANOVA используется для поддержки других статистических методов. Регрессия сначала применяется для подгонки более сложных моделей к данным, а затем ANOVA используется для сравнения моделей с целью выбора более простых моделей, которые адекватно описывают данные. "Такие модели можно подгонять без какой-либо привязки к ANOVA, но инструменты ANOVA могут быть использованы для интерпретации полученных моделей и проверки гипотез относительно групп коэффициентов". "Мы рассматриваем анализ дисперсии как способ понимания и структурирования многоуровневых моделей – не как альтернативу регрессии, а как инструмент для обобщения сложных многомерных выводов". Следовательно, широко используются факторные планы. Использование ANOVA для изучения влияния нескольких факторов имеет свои сложности. В трехфакторном ANOVA с факторами x, y и z модель ANOVA включает слагаемые для основных эффектов (x, y, z) и слагаемые для взаимодействий (xy, xz, yz, xyz). Все слагаемые требуют проверки гипотез. Увеличение числа слагаемых, описывающих взаимодействия, повышает риск получения ложноположительного результата в одном из тестов гипотез. К счастью, опыт показывает, что взаимодействия высокого порядка встречаются редко. Возможность выявлять взаимодействия является важным преимуществом многофакторного ANOVA. Проверка каждого фактора по отдельности скрывает взаимодействия, но приводит к кажущимся противоречивым экспериментальным результатам. Для лучшего понимания рекомендуется использовать графические методы. Регрессия часто бывает полезна. Подробное обсуждение взаимодействий представлено в работе Кокса (1958). Некоторые взаимодействия можно устранить (путем преобразований), а другие – нет. Для снижения затрат при многофакторном ANOVA используются различные методы. Один из методов, применяемых в факторных планах, – минимизация числа повторений (вплоть до полного их отсутствия при использовании аналитических приемов) и объединение групп, когда эффекты оказываются статистически (или практически) незначимыми. Эксперимент с большим количеством незначимых факторов может быть сведен к эксперименту с небольшим числом факторов, подтвержденным множеством повторений.
Связанный анализ
Необходим определённый анализ для поддержки разработки эксперимента, а другой анализ проводится после того, как формально установлено, что изменения факторов приводят к статистически значимым изменениям в результатах. Поскольку экспериментирование носит итеративный характер, результаты одного эксперимента влияют на планы последующих экспериментов.
Количество экспериментальных единиц
При разработке эксперимента количество экспериментальных единиц планируется таким образом, чтобы соответствовать целям исследования. Эксперименты часто проводятся последовательно. Ранние эксперименты обычно разрабатываются для получения усредненных несмещенных оценок эффектов воздействия и экспериментальной ошибки. Поздние эксперименты часто разрабатываются для проверки гипотезы о значительной величине эффекта воздействия; в этом случае количество экспериментальных единиц выбирается с учетом бюджетных ограничений и необходимой мощности, среди прочих целей. В психологии обычно требуется представлять анализ размера выборки. "Предоставьте информацию о размере выборки и процессе принятия решений относительно его определения". Этот анализ, который записывается в протоколе эксперимента до его проведения, рассматривается при подаче заявок на гранты и в административных советах по этике. Помимо анализа мощности, существуют менее формальные методы определения количества экспериментальных единиц. К ним относятся графические методы, основанные на ограничении вероятности ошибок второго рода, графические методы, основанные на ожидаемом увеличении разброса (по сравнению с остатками), и методы, основанные на достижении желаемой ширины доверительного интервала.
Анализ мощности
Анализ мощности часто применяется в контексте ANOVA для оценки вероятности успешного отклонения нулевой гипотезы при заданном дизайне ANOVA, размере эффекта в популяции, объеме выборки и уровне значимости. Анализ мощности может помочь в планировании исследования, позволяя определить необходимый объем выборки для достижения приемлемой вероятности отклонения нулевой гипотезы, когда альтернативная гипотеза верна.
Размер эффекта
Для анализа дисперсии (ANOVA) было предложено несколько стандартизированных мер эффекта, позволяющих оценить силу связи между предиктором (предикторами) и зависимой переменной, или общую стандартизированную разницу, объясняемую всей моделью. Стандартизированные оценки размера эффекта облегчают сопоставление результатов, полученных в разных исследованиях и областях знаний. Однако, несмотря на широкое использование стандартизированных размеров эффекта в профессиональной литературе, для представления результатов может быть предпочтительнее использовать нестандартизированную меру размера эффекта, выраженную в единицах, имеющих непосредственный смысл.
Подтверждение модели
Иногда проводятся тесты для проверки, не нарушены ли предположения ANOVA. Остатки исследуются или анализируются для подтверждения гомоскедастичности и приблизительной нормальности. Остатки при графическом изображении в зависимости от чего-либо, включая время и смоделированные значения данных, должны выглядеть как (нормальное распределение с нулевым средним) шум. Наличие трендов может указывать на взаимодействие между факторами или между наблюдениями.
modeled data values. Trends hint at interactions among factors or among observations.
Последующие испытания
После статистически значимого эффекта в ANOVA часто проводятся дополнительные тесты. Это делается для того, чтобы определить, какие группы отличаются друг от друга, или для проверки других конкретных гипотез. Последующие тесты часто классифицируются как "планируемые" (априорные) или "пост-хок". Планируемые тесты определяются до анализа данных, а пост-хок тесты формулируются уже после ознакомления с данными (хотя термин "пост-хок" используется не всегда последовательно). Последующие тесты могут представлять собой "простые" попарные сравнения средних значений отдельных групп или "комплексные" сравнения (например, сравнение объединенного среднего значений групп A, B и C со средним значением группы D). Сравнения также могут включать проверку трендов, таких как линейные и квадратичные зависимости, когда независимая переменная имеет упорядоченные уровни. Часто в последующих тестах используется метод коррекции на множественные сравнения. К последующим тестам, позволяющим выявить конкретные группы, переменные или факторы со статистически различающимися средними значениями, относятся тест диапазона Тьюки и новый множественный тест диапазона Дункана. В свою очередь, эти тесты часто дополняются методологией компактного буквенного отображения (CLD), чтобы сделать результаты более понятными для аудитории, не имеющей специальной статистической подготовки.
Предупреждения
Сбалансированные эксперименты (эксперименты с одинаковым размером выборки для каждой группы лечения) относительно легко интерпретировать, тогда как несбалансированные эксперименты более сложны. Для однофакторного (одностороннего) дисперсионного анализа (ANOVA) корректировка несбалансированных данных проста, но такой анализ обладает меньшей устойчивостью и мощностью. Для более сложных схем отсутствие баланса приводит к дополнительным осложнениям. "Свойство ортогональности главных эффектов и взаимодействий, присущее сбалансированным данным, не сохраняется в несбалансированном случае. Это означает, что стандартные методы дисперсионного анализа неприменимы. Следовательно, анализ несбалансированных факторных экспериментов значительно сложнее, чем анализ сбалансированных схем". В общем случае, "дисперсионный анализ также может быть применен к несбалансированным данным, но тогда суммы квадратов, средние квадраты и F-статистики будут зависеть от порядка рассмотрения источников изменчивости", что, в свою очередь, является частным случаем общей линейной модели. Все подходы рассматривают наблюдения как сумму модели (аппроксимации) и остаточной (ошибочной) составляющих, которые необходимо минимизировать. Тест Крускала-Уоллиса и тест Фридмана – это непараметрические тесты, не требующие предположения о нормальности распределения.