Введение

Статистическая мера Fleiss' kappa (названная в честь Джозефа Л. Флейса) - это статистическая мера для оценки надежности согласия между фиксированным числом рейтинговых агентов при присвоении категорических рейтингов ряду пунктов или классификации пунктов. Это контрастирует с другими каппами, такими как каппа Коэна, которые работают только при оценке соглашения между не более чем двумя оценщиками или надежности внутри оценщика (для одного оценщика против себя). Эта мера рассчитывает степень согласия в классификации по сравнению с тем, что можно было бы ожидать случайно. Каппа Флейса может использоваться с бинарной или номинальной шкалой. Он также может применяться к порядковым данным (ранкированным данным): в онлайн-документации MiniTab приведен пример. Однако в этом документе отмечается: "Когда у вас есть порядковые оценки, например, оценки тяжести дефектов по шкале 15, коэффициенты Кендалла, которые учитывают порядок, обычно являются более подходящими статистическими данными для определения ассоциации, чем каппа в одиночку". Однако имейте в виду, что коэффициенты ранга Кендалла подходят только для данных о ранге.

Введение

Флейсская каппа является обобщением статистики пи Скотта, статистической мерой надежности интеррейтера. Он также связан со статистикой Коэна по каппе и статистикой Юдена по J, которая может быть более подходящей в определенных случаях. В то время как пи Скотта и каппа Коэна работают только для двух оценщиков, каппа Флейса работает для любого количества оценщиков, дающих категорические оценки, для фиксированного количества пунктов, при условии, что для каждого пункта оценщики выбираются случайным образом. Его можно интерпретировать как выражение степени, в которой наблюдаемая степень согласия между рейтинговыми агентами превышает то, что можно было бы ожидать, если бы все рейтинговые агенты делали свои рейтинги совершенно случайным образом. Важно отметить, что в то время как каппа Коэна предполагает, что два одинаковых оценщика оценили набор статей, каппа Флейса конкретно допускает, что, хотя есть фиксированное количество оценщиков (например, три), разные статьи могут быть оценены разными лицами. То есть пункт 1 оценивается рейтингами А, В и С; но пункт 2 может быть оценен рейтингами D, E и F. Условие случайной выборки среди рейтинговых оценщиков делает каппу Флисса не подходящей для случаев, когда все рейтинговые оценки оценивают всех пациентов. Соглашение можно рассматривать следующим образом: если фиксированное количество людей присваивает числовые рейтинги ряду пунктов, то каппа даст меру того, насколько согласованны рейтинги. Каппа, , может быть определена как: (1) Фактор дает степень согласия, которая достижима вне случая, и, дает степень согласия, фактически достигнутой вне случая. Если оценщики полностью согласны, то Если нет согласия среди оценщиков (кроме того, что ожидается случайно), то Примером использования каппы Флисса может быть следующее: рассмотрим несколько психиатров, которых просят рассмотреть десять пациентов. Для каждого пациента 14 психиатров дают один из пяти возможных диагнозов. Они составляются в матрицу, и каппа Флисса может быть вычислена из этой матрицы (см. пример ниже), чтобы показать степень согласия между психиатрами выше уровня согласия, ожидаемого случайно.

Интерпретация

приведена ниже таблица для интерпретации значений для примера класса 2 аннотатора 2. Однако эта таблица не является общепринятой. Они не приводили никаких доказательств в поддержку этого, основываясь на собственном мнении. Было отмечено, что эти руководящие принципы могут быть более вредными, чем полезными, поскольку количество категорий и предметов будет влиять на величину значения. Например, каппа выше, когда меньше категорий. Интерпретация условий Субъективный пример: только для двух аннотаторов, на двух классах. < 0 Недостаточное согласие 0.01 0.20 Незначительное согласие 0.21 0.40 Справедливое согласие 0.41 0.60 Умеренное согласие 0.61 0.80 Значительное согласие 0.81 1.00 Почти идеальное согласие

Тесты значимости

Статистические пакеты могут рассчитать стандартный балл (Z-балл) для каппы Коэна или каппы Флейса, который может быть преобразован в значение P. Однако даже когда значение P достигает порога статистической значимости (обычно меньше 0,05), это только указывает на то, что согласие между оценщиками значительно лучше, чем можно было бы ожидать случайно. Значение p не говорит вам, само по себе, достаточно ли хороша согласие, чтобы иметь высокую прогнозную ценность.