Введение

Статистический тест

В статистике G-тесты — это статистические тесты отношения правдоподобия или максимального правдоподобия, которые все чаще применяются в ситуациях, где ранее рекомендовалось использовать критерий хи-квадрат.

Вывод

Мы можем вывести значение G-теста из теста отношения правдоподобия, где базовой моделью является мультиномиальная модель. Предположим, у нас есть выборка, в которой каждый – это количество раз, когда объект типа был наблюдаем. Кроме того, пусть – общее количество наблюдаемых объектов. Если мы предполагаем, что базовая модель является мультиномиальной, то статистика теста определяется как, где – нулевая гипотеза, а – оценка максимального правдоподобия (MLE) параметров, полученная по данным. Вспомним, что для мультиномиальной модели MLE определяется как: Кроме того, мы можем представить каждый параметр нулевой гипотезы как: Таким образом, подставляя представления и в отношение правдоподобия в логарифмической форме, уравнение упрощается до: Переобозначим переменные через и через . Наконец, умножим на коэффициент (используется для того, чтобы сделать формулу G-теста асимптотически эквивалентной формуле хи-квадрат Пирсона) для получения следующего вида:

Эвристически, можно представить как непрерывную величину, стремящуюся к нулю, в этом случае и члены с нулевыми наблюдениями можно просто отбросить. Однако ожидаемое количество в каждой ячейке должно быть строго больше нуля для каждой ячейки, чтобы применять данный метод.

Распространение и использование

При нулевой гипотезе о том, что наблюдаемые частоты являются результатом случайной выборки из распределения с заданными ожидаемыми частотами, распределение статистики G приблизительно соответствует хи-квадрат распределению с таким же числом степеней свободы, как и в соответствующем хи-квадрат тесте. Для очень малых выборок предпочтительнее многочленный тест на соответствие, точный тест Фишера для таблиц сопряженности или даже байесовский выбор гипотез, чем G-тест. Макдональд рекомендует всегда использовать точный тест (точный тест на соответствие, точный тест Фишера), если общий размер выборки меньше 1000. Нет ничего особенного в размере выборки 1000, это просто удобное округленное число, которое находится в диапазоне, где точный тест, хи-квадрат тест и G-тест дадут почти идентичные p-значения. Электронные таблицы, веб-калькуляторы и SAS не должны испытывать проблем с проведением точного теста при размере выборки 1000. — John H. McDonald

Применение

Тест Макдональд — Крайтмана в статистической генетике является применением G-теста. Даннинг представил этот тест сообществу компьютерной лингвистики, где он сейчас широко используется. Программа R scape (используемая Rfam) применяет G-тест для выявления ковариации между позициями выравнивания последовательностей РНК.

Статистическое программное обеспечение

В R быстрые реализации можно найти в пакетах AMR и Rfast. Для пакета AMR команда g.test работает точно так же, как chisq.test из базового R. В R также есть функция likelihood.test в пакете Deducer. Важно отметить: G-тест Фишера в пакете GeneCycle языка программирования R (fisher.g.test) не реализует G-тест, как описано в этой статье, а скорее точный тест Фишера для гауссовского белого шума во временном ряду. Другая реализация в R для вычисления статистики G и соответствующих p-значений предоставляется пакетом entropy. Команды: Gstat для стандартной статистики G и связанного с ней p-значения, и Gstatindep для статистики G, применяемой для сравнения совместных и произведенных распределений для проверки независимости. В SAS можно провести G-тест, используя опцию /chisq после команды proc freq. В Stata можно провести G-тест, используя опцию lr после команды tabulate. В Java используйте org.apache.commons.math3.stat.inference.GTest. В Python используйте scipy.stats.power_divergence с lambda = 0.