Введение
Таблица, отображающая частоту переменных, и кросс-табуляция, которая агрегирует данные путем суммирования, усреднения и т.д. (а не только подсчетом). В статистике таблица сопряженности (также известная как кросс-табуляция или crosstab) – это тип таблицы в матричном формате, отображающий многомерное распределение частот переменных. Они широко используются в социологических исследованиях, бизнес-аналитике, инженерии и научных исследованиях. Они дают общую картину взаимосвязи между двумя переменными и могут помочь выявить взаимодействия между ними. Термин "таблица сопряженности" впервые был использован Карлом Пирсоном в работе "О теории сопряженности и ее связи с ассоциацией и нормальной корреляцией", являющейся частью "Исследовательских мемуаров компании Дрейперс, биометрической серии I", опубликованной в 1904 году. Важной задачей многомерной статистики является определение структуры (прямых) зависимостей, лежащей в основе переменных, содержащихся в многомерных таблицах сопряженности. Если некоторые условные независимости будут выявлены, то даже хранение данных можно оптимизировать (см. Lauritzen, 2002). Для этого можно использовать концепции теории информации, которые извлекают информацию только из распределения вероятностей, которое можно легко выразить из таблицы сопряженности с помощью относительных частот. Сводная таблица – это способ создания таблиц сопряженности с использованием программного обеспечения для работы с электронными таблицами.
cross tabulation that aggregates by summing, averaging, etc. (rather than only by counting)
In statistics, a contingency table (also known as a cross tabulation or crosstab) is a type of table in a matrix format that displays the multivariate frequency distribution of the variables. They are heavily used in survey research, business intelligence, engineering, and scientific research. They provide a basic picture of the interrelation between two variables and can help find interactions between them. The term contingency table was first used by Karl Pearson in "On the Theory of Contingency and Its Relation to Association and Normal Correlation", part of the Drapers' Company Research Memoirs Biometric Series I published in 1904. A crucial problem of multivariate statistics is finding the (direct )dependence structure underlying the variables contained in high dimensional contingency tables. If some of the conditional independences are revealed, then even the storage of the data can be done in a smarter way (see Lauritzen (2002)). In order to do this one can use information theory concepts, which gain the information only from the distribution of probability, which can be expressed easily from the contingency table by the relative frequencies. A pivot table is a way to create contingency tables using spreadsheet software.
Стандартное содержание таблицы непредвиденных ситуаций
Многочисленные столбцы (исторически они были разработаны для использования всего свободного пространства на печатной странице). Если каждая строка относится к определенной подгруппе населения (в данном случае мужчины или женщины), столбцы иногда называют баннерными заголовками или разрезами (а строки – пнями). Тесты значимости. Как правило, это либо сравнение столбцов, которое проверяет различия между столбцами и отображает эти результаты с помощью букв, либо сравнение ячеек, которое использует цвет или стрелки для выделения ячейки в таблице, отличающейся каким-либо образом. Итоговые значения или нетто. Один или несколько из следующих показателей: проценты, проценты по строкам, проценты по столбцам, индексы или средние значения. Не взвешенные объемы выборки (количество).
Мероприятия по ассоциации
Степень связи между двумя переменными может быть оценена с помощью нескольких коэффициентов. В следующих разделах описаны некоторые из них. Для более полного обсуждения их использования см. основные статьи, на которые есть ссылки в заголовках каждого раздела.
Коэффициент тетрахорической корреляции
Другим вариантом является тетрахорический коэффициент корреляции, но он применим только к таблицам 2 × 2. Полихорическая корреляция является обобщением тетрахорической корреляции на таблицы, включающие переменные с более чем двумя уровнями. Тетрахорическая корреляция предполагает, что переменная, лежащая в основе каждого дихотомического показателя, имеет нормальное распределение. Коэффициент предоставляет "удобную меру корреляции [момента произведения Пирсона] в случае, когда шкальные измерения были сведены к двум категориям". Тетрахорический коэффициент корреляции не следует путать с коэффициентом корреляции Пирсона, вычисляемым путем присвоения, например, значений 0,0 и 1,0 для представления двух уровней каждой переменной (что математически эквивалентно коэффициенту φ).
Коэффициент Ламбды
Коэффициент лямбды — это мера силы связи в таблицах сопряженности, когда переменные измеряются на номинальном уровне. Значения изменяются от 0,0 (отсутствие связи) до 1,0 (максимально возможная связь). Асимметричная лямбда измеряет процент улучшения при прогнозировании зависимой переменной. Симметричная лямбда измеряет процент улучшения при прогнозировании в обоих направлениях.
Другие
Гамма-тест: не вносит поправки ни на размер таблицы, ни на совпадения. Тау Кендалла: вносит поправку на совпадения. Tau b: используется для квадратных таблиц. Tau c: используется для прямоугольных таблиц.