Тест Кохрана — Армитаджа для анализа трендов в категориальных данных
Cochran–Armitage test for trend
Тест Кохрана-Армитаджа: анализ связи между категориальными данными и упорядоченной переменной. Применение в генетических исследованиях и дозировке лечения.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Содержание
Введение
Тест Кокрана — Армитажа для выявления тренда, названный в честь Уильяма Кокрана и Питера Армитажа, используется в анализе категориальных данных, когда необходимо оценить наличие связи между переменной с двумя категориями и порядковой переменной с k категориями. Он является модификацией критерия Пирсона хи-квадрат, позволяющей учесть предполагаемый порядок влияния k категорий второй переменной. Например, дозы лекарственного препарата можно упорядочить как «низкая», «средняя» и «высокая», и можно предположить, что эффект от лечения не будет уменьшаться с увеличением дозы. Тест на тренд часто применяется в качестве генотип-ориентированного теста в генетических исследованиях ассоциаций типа «случай-контроль».
The Cochran–Armitage test for trend, named for William Cochran and Peter Armitage, is used in categorical data analysis when the aim is to assess for the presence of an association between a variable with two categories and an ordinal variable with k categories. It modifies the Pearson chi squared test to incorporate a suspected ordering in the effects of the k categories of the second variable. For example, doses of a treatment can be ordered as 'low', 'medium', and 'high', and we may suspect that the treatment benefit cannot become smaller as the dose increases. The trend test is often used as a genotype based test for case control genetic association studies.
Введение
Тенденционный тест применяется, когда данные представлены в виде таблицы сопряженности 2 × k. Например, если k = 3, то мы имеем:
The trend test is applied when the data take the form of a 2 × k contingency table. For example, if k = 3 we have
B = 1 B = 2 B = 3
A = 1 N11 N12 N13
A = 2 N21 N22 N23
B = 1 B = 2 B = 3 A = 1 N11 N12 N13 A = 2 N21 N22 N23
Эту таблицу можно дополнить суммарными значениями по строкам и столбцам двух переменных:
This table can be completed with the marginal totals of the two variables
B = 1 B = 2 B = 3 Сумма
A = 1 N11 N12 N13 R1
A = 2 N21 N22 N23 R2
Сумма C1 C2 C3 N
B = 1 B = 2 B = 3 Sum A = 1 N11 N12 N13 R1 A = 2 N21 N22 N23 R2 Sum C1 C2 C3 N
где R1 = N11 + N12 + N13, и C1 = N11 + N21, и т.д. Статистика теста тренда имеет вид:
where R1 = N11 + N12 + N13, and
C1 = N11 + N21, etc. The trend test statistic is
где ti – веса, а разность N1iR2 − N2iR1 можно рассматривать как разность между N1i и N2i после перевзвешивания строк, чтобы они имели одинаковую сумму. Гипотеза об отсутствии связи (нулевая гипотеза) может быть выражена следующим образом:
where the ti are weights, and the difference N1iR2 −N2iR1 can be seen as the difference between N1i and N2i after reweighting the rows to have the same total. The hypothesis of no association (the null hypothesis) can be expressed as:
Предполагая, что это верно, то, используя итерированное математическое ожидание,
Assuming this holds, then, using iterated expectation,
Дисперсия может быть вычислена путем разложения, что дает:
The variance can be computed by decomposition, yielding
и как приближение для больших выборок:
and as a large sample approximation,
Веса ti можно выбрать таким образом, чтобы тест тренда стал локально наиболее мощным для обнаружения определенных типов связей. Например, если k = 3 и мы подозреваем, что B = 1 и B = 2 имеют схожие частоты (в каждой строке), но B = 3 имеет другую частоту, то следует использовать веса t = (1, 1, 0). Если мы подозреваем линейную тенденцию частот, то следует использовать веса t = (0, 1, 2). Эти веса также часто используются, когда предполагается, что частоты монотонно изменяются с B, даже если тенденция не обязательно линейная.
The weights ti can be chosen such that the trend test becomes locally most powerful for detecting particular types of associations. For example, if k = 3 and we suspect that B = 1 and B = 2 have similar frequencies (within each row), but that B = 3 has a different frequency, then the weights t = (1,1,0) should be used. If we suspect a linear trend in the frequencies, then the weights t = (0,1,2) should be used. These weights are also often used when the frequencies are suspected to change monotonically with B, even if the trend is not necessarily linear.
Интерпретация и роль
Тест на тренд обладает большей мощностью, чем критерий хи-квадрат, когда предполагаемый тренд верен, но при этом теряется способность выявлять неожиданные тренды. Это пример общей методики направления проверки гипотез на конкретные альтернативы. Тест на тренд использует предполагаемое направление эффекта для повышения мощности, однако это не влияет на выборочное распределение статистики теста при нулевой гипотезе. Следовательно, предполагаемый тренд в эффектах не является предположением, которое должно выполняться для того, чтобы результаты теста имели смысл.
The trend test will have higher power than the chi squared test when the suspected trend is correct, but the ability to detect unsuspected trends is sacrificed. This is an example of a general technique of directing hypothesis tests toward narrow alternatives. The trend test exploits the suspected effect direction to increase power, but this does not affect the sampling distribution of the test statistic under the null hypothesis. Thus, the suspected trend in effects is not an assumption that must hold in order for the test results to be meaningful.