Введение
Статистическая мера Fleiss' kappa (названная в честь Джозефа Л. Флейса) - это статистическая мера для оценки надежности согласия между фиксированным числом рейтинговых агентов при присвоении категорических рейтингов ряду пунктов или классификации пунктов. Это контрастирует с другими каппами, такими как каппа Коэна, которые работают только при оценке соглашения между не более чем двумя оценщиками или надежности внутри оценщика (для одного оценщика против себя). Эта мера рассчитывает степень согласия в классификации по сравнению с тем, что можно было бы ожидать случайно. Каппа Флейса может использоваться с бинарной или номинальной шкалой. Он также может применяться к порядковым данным (ранкированным данным): в онлайн-документации MiniTab приведен пример. Однако в этом документе отмечается: "Когда у вас есть порядковые оценки, например, оценки тяжести дефектов по шкале 15, коэффициенты Кендалла, которые учитывают порядок, обычно являются более подходящими статистическими данными для определения ассоциации, чем каппа в одиночку". Однако имейте в виду, что коэффициенты ранга Кендалла подходят только для данных о ранге.
Fleiss' kappa (named after Joseph L. Fleiss) is a statistical measure for assessing the reliability of agreement between a fixed number of raters when assigning categorical ratings to a number of items or classifying items. This contrasts with other kappas such as Cohen's kappa, which only work when assessing the agreement between not more than two raters or the intra rater reliability (for one appraiser versus themself). The measure calculates the degree of agreement in classification over that which would be expected by chance. Fleiss' kappa can be used with binary or nominal scale. It can also be applied to ordinal data (ranked data): the MiniTab online documentation gives an example. However, this document notes: "When you have ordinal ratings, such as defect severity ratings on a scale of 1–5, Kendall's coefficients, which account for ordering, are usually more appropriate statistics to determine association than kappa alone." Keep in mind however, that Kendall rank coefficients are only appropriate for rank data.
Введение
Флейсская каппа является обобщением статистики пи Скотта, статистической мерой надежности интеррейтера. Он также связан со статистикой Коэна по каппе и статистикой Юдена по J, которая может быть более подходящей в определенных случаях. В то время как пи Скотта и каппа Коэна работают только для двух оценщиков, каппа Флейса работает для любого количества оценщиков, дающих категорические оценки, для фиксированного количества пунктов, при условии, что для каждого пункта оценщики выбираются случайным образом. Его можно интерпретировать как выражение степени, в которой наблюдаемая степень согласия между рейтинговыми агентами превышает то, что можно было бы ожидать, если бы все рейтинговые агенты делали свои рейтинги совершенно случайным образом. Важно отметить, что в то время как каппа Коэна предполагает, что два одинаковых оценщика оценили набор статей, каппа Флейса конкретно допускает, что, хотя есть фиксированное количество оценщиков (например, три), разные статьи могут быть оценены разными лицами. То есть пункт 1 оценивается рейтингами А, В и С; но пункт 2 может быть оценен рейтингами D, E и F. Условие случайной выборки среди рейтинговых оценщиков делает каппу Флисса не подходящей для случаев, когда все рейтинговые оценки оценивают всех пациентов. Соглашение можно рассматривать следующим образом: если фиксированное количество людей присваивает числовые рейтинги ряду пунктов, то каппа даст меру того, насколько согласованны рейтинги. Каппа, , может быть определена как: (1) Фактор дает степень согласия, которая достижима вне случая, и, дает степень согласия, фактически достигнутой вне случая. Если оценщики полностью согласны, то Если нет согласия среди оценщиков (кроме того, что ожидается случайно), то Примером использования каппы Флисса может быть следующее: рассмотрим несколько психиатров, которых просят рассмотреть десять пациентов. Для каждого пациента 14 психиатров дают один из пяти возможных диагнозов. Они составляются в матрицу, и каппа Флисса может быть вычислена из этой матрицы (см. пример ниже), чтобы показать степень согласия между психиатрами выше уровня согласия, ожидаемого случайно.
(1)
The factor gives the degree of agreement that is attainable above chance, and, gives the degree of agreement actually achieved above chance. If the raters are in complete agreement then If there is no agreement among the raters (other than what would be expected by chance) then
An example of using Fleiss' kappa may be the following: consider several psychiatrists who are asked to look at ten patients. For each patient, 14 psychiatrists give one of possibly five diagnoses. These are compiled into a matrix, and Fleiss' kappa can be computed from this matrix (see example below) to show the degree of agreement between the psychiatrists above the level of agreement expected by chance.
Интерпретация
приведена ниже таблица для интерпретации значений для примера класса 2 аннотатора 2. Однако эта таблица не является общепринятой. Они не приводили никаких доказательств в поддержку этого, основываясь на собственном мнении. Было отмечено, что эти руководящие принципы могут быть более вредными, чем полезными, поскольку количество категорий и предметов будет влиять на величину значения. Например, каппа выше, когда меньше категорий. Интерпретация условий Субъективный пример: только для двух аннотаторов, на двух классах. < 0 Недостаточное согласие 0.01 0.20 Незначительное согласие 0.21 0.40 Справедливое согласие 0.41 0.60 Умеренное согласие 0.61 0.80 Значительное согласие 0.81 1.00 Почти идеальное согласие
Тесты значимости
Статистические пакеты могут рассчитать стандартный балл (Z-балл) для каппы Коэна или каппы Флейса, который может быть преобразован в значение P. Однако даже когда значение P достигает порога статистической значимости (обычно меньше 0,05), это только указывает на то, что согласие между оценщиками значительно лучше, чем можно было бы ожидать случайно. Значение p не говорит вам, само по себе, достаточно ли хороша согласие, чтобы иметь высокую прогнозную ценность.