Введение

Переменная, способная принимать ограниченное число возможных значений. В статистике, категорическая переменная (также называемая качественной переменной) – это переменная, которая может принимать одно из ограниченного и обычно фиксированного числа возможных значений, присваивая каждую отдельную единицу наблюдения или другую единицу наблюдения определенной группе или номинальной категории на основе какого-либо качественного признака. В информатике и некоторых областях математики категорические переменные называют перечислениями или перечисляемыми типами. Как правило (хотя и не в данной статье), каждое из возможных значений категорической переменной называют уровнем. Распределение вероятностей, связанное со случайной категорической переменной, называется категориальным распределением. Категориальные данные – это тип статистических данных, состоящий из категорических переменных или данных, преобразованных в эту форму, например, в виде сгруппированных данных. В частности, категориальные данные могут быть получены из наблюдений качественных данных, суммированных в виде подсчетов или перекрестных таблиц, или из наблюдений количественных данных, сгруппированных по заданным интервалам. Часто чисто категориальные данные суммируются в виде таблицы сопряженности. Однако, особенно при анализе данных, термин «категориальные данные» обычно используется для обозначения наборов данных, которые, хотя и содержат некоторые категорические переменные, могут также содержать и некатегорические переменные. Категорическая переменная, которая может принимать ровно два значения, называется бинарной или дихотомической переменной; важным частным случаем является переменная Бернулли. Категорические переменные с более чем двумя возможными значениями называются политомическими переменными; категорические переменные часто предполагаются политомическими, если не указано иное. Дискретизация – это обработка непрерывных данных как категориальных. Дихотомизация – это обработка непрерывных данных или политомических переменных как бинарных переменных. Регрессионный анализ часто рассматривает принадлежность к категории с помощью одной или нескольких количественных дамми-переменных.

Обозначение

Для облегчения статистической обработки, категорическим переменным могут быть присвоены числовые индексы, например, от 1 до K для K-значной категорической переменной (то есть переменной, которая может принимать ровно K различных значений). Однако в целом эти числа произвольны и не имеют значения, кроме как удобной метки для конкретного значения. Иными словами, значения в категорической переменной существуют в номинальной шкале: каждое из них представляет собой логически отдельную концепцию, не обязательно может быть осмысленно упорядочено и не может быть иным образом манипулировано как числа. Вместо этого допустимыми операциями являются проверка на равенство, принадлежность к множеству и другие операции, связанные с множествами. Следовательно, центральная тенденция набора категорических переменных определяется модой; ни среднее, ни медиана не могут быть определены. В качестве примера, рассмотрим набор людей и соответствующий набор категорических переменных, представляющих их фамилии. Мы можем выполнять такие операции, как проверка на равенство (имеют ли два человека одинаковую фамилию), проверка принадлежности к множеству (есть ли у человека фамилия в данном списке), подсчет (сколько человек имеют данную фамилию) или поиск моды (какая фамилия встречается чаще всего). Однако мы не можем осмысленно вычислить "сумму" Смит + Джонсон или спросить, является ли Смит "меньше" или "больше" Джонсона. Следовательно, мы не можем осмысленно спросить, что такое "средняя фамилия" (среднее) или "средняя по порядку фамилия" (медиана) в наборе фамилий. Это игнорирует концепцию алфавитного порядка, которая является свойством не самих фамилий, а способа, которым мы определяем эти метки. Например, если мы запишем фамилии кириллицей и будем учитывать порядок букв в кириллице, мы можем получить другой результат при оценке "Смит < Джонсон", чем если бы мы записали фамилии в стандартном латинском алфавите; и если мы запишем фамилии китайскими иероглифами, мы вообще не сможем осмысленно оценить "Смит < Джонсон", поскольку для таких иероглифов не определен последовательный порядок. Однако, если мы рассматриваем фамилии в том виде, в котором они написаны, например, в латинском алфавите, и определим порядок, соответствующий стандартному алфавитному порядку, то мы фактически преобразуем их в порядковые переменные, определенные в порядковой шкале.

Количество возможных значений

Категорические случайные переменные обычно описываются статистически с помощью категориального распределения, которое позволяет представить произвольную K-разрядную категориальную переменную отдельными вероятностями для каждого из K возможных исходов. Такие многокатегорийные переменные часто анализируются с использованием многочленного распределения, подсчитывающего частоту каждой возможной комбинации чисел появлений различных категорий. Регрессионный анализ категориальных результатов проводится с помощью многочленной логистической регрессии, многочленной пробит-регрессии или связанных типов моделей дискретного выбора. Категорические переменные, имеющие только два возможных исхода (например, "да" или "нет", "успех" или "неудача"), называются бинарными (или переменными Бернулли). В силу своей важности, эти переменные часто рассматриваются как отдельная категория, с собственным распределением (распределением Бернулли) и отдельными моделями регрессии (логистическая регрессия, пробит-регрессия и т. д.). В результате термин "категорическая переменная" часто резервируется для случаев с 3 и более исходами, иногда называемых многосторонними переменными в отличие от бинарных. Также возможно рассматривать категориальные переменные, где число категорий не фиксировано заранее. Например, для категориальной переменной, описывающей конкретное слово, мы можем не знать заранее размер словаря и хотим предусмотреть возможность встретить слова, которые мы еще не видели. Стандартные статистические модели, такие как те, что используют категориальное распределение и многочленную логистическую регрессию, предполагают, что число категорий известно заранее, и изменение числа категорий "на лету" затруднительно. В таких случаях необходимо использовать более продвинутые методы. Примером является процесс Дирихле, относящийся к области непараметрической статистики. В этом случае логически предполагается существование бесконечного числа категорий, но в любой момент времени большинство из них (фактически, все, кроме конечного числа) никогда не наблюдались. Все формулы выражаются через количество категорий, фактически наблюдавшихся на данный момент, а не через (бесконечное) общее число потенциальных категорий, и разработаны методы для поэтапного обновления статистических распределений, включая добавление "новых" категорий.

Бессмысленное кодирование

Бессмысленное кодирование возникает, когда вместо установленных значений "0", "1" и "-1", используемых в предыдущих системах кодирования, применяются произвольные значения. Хотя это и позволяет получить корректные средние значения переменных, использование бессмысленного кодирования не рекомендуется, так как приводит к статистическим результатам, которые невозможно интерпретировать.

Встраивания

Встраивания — это представление категориальных значений в виде векторов в многомерном вещественном (иногда комплексном) пространстве, как правило, таким образом, что «похожие» значения отображаются в «похожие» векторы, или в соответствии с каким-либо другим критерием, делающим векторы полезными для конкретной задачи. Распространенным частным случаем являются векторные представления слов, где возможными значениями категориальной переменной являются слова языка, а словам с близким значением соответствуют близкие векторы.

Взаимодействия

Взаимодействие может возникать при рассмотрении взаимосвязи между тремя или более переменными и описывает ситуацию, в которой совместное влияние двух переменных на третью не является суммарным. Взаимодействия с категориальными переменными могут возникать двумя способами: взаимодействие категориальной переменной с категориальной переменной или взаимодействие категориальной переменной с непрерывной переменной.

Категорические взаимодействия категорических переменных

Этот тип взаимодействия возникает при наличии двух категориальных переменных. Для изучения этого типа взаимодействия следует использовать систему кодирования, наиболее точно соответствующую гипотезе исследователя. Произведение кодов определяет взаимодействие. После этого можно вычислить коэффициент b и установить, является ли взаимодействие статистически значимым.

Категорические по непрерывным переменным взаимодействиям

Простой анализ наклонов – распространенный пост-хок тест, используемый в регрессионном анализе, аналогичный анализу простых эффектов в ANOVA, применяемому для анализа взаимодействий. В этом тесте мы исследуем простые наклоны одной независимой переменной при конкретных значениях другой независимой переменной. Этот тест не ограничивается использованием только с непрерывными переменными, но также может применяться, когда независимая переменная является категориальной. Мы не можем произвольно выбирать значения для изучения взаимодействия, как это делается в случае с непрерывными переменными, из-за номинальной природы категориальных данных (то есть, в случае непрерывных переменных можно анализировать данные на высоких, умеренных и низких уровнях, определяемых как одно стандартное отклонение выше среднего, на среднем уровне и одно стандартное отклонение ниже среднего, соответственно). В случае категориальных переменных мы используем простое регрессионное уравнение для каждой группы, чтобы исследовать простые наклоны. Распространенной практикой является стандартизация или центрирование переменных для облегчения интерпретации данных при проведении простого анализа наклонов; однако категориальные переменные никогда не следует стандартизировать или центрировать. Этот тест совместим со всеми системами кодирования.