Введение

Общая согласованность измерения в статистике и психометрии

В статистике и психометрии надежность – это общая согласованность измерения. Измерение считается обладающим высокой надежностью, если оно дает схожие результаты при одинаковых условиях: «Это характеристика набора тестовых баллов, отражающая величину случайной ошибки, возникающей в процессе измерения и потенциально влияющей на баллы. Баллы с высокой надежностью точны, воспроизводимы и стабильны при повторном тестировании. То есть, если бы процесс тестирования был повторен с той же группой испытуемых, были бы получены практически идентичные результаты. Для оценки величины ошибки в баллах обычно используются различные коэффициенты надежности, значения которых варьируются от 0,00 (большая ошибка) до 1,00 (отсутствие ошибки). Например, измерения роста и веса людей часто отличаются очень высокой надежностью.»

Общая модель

На практике, методы тестирования никогда не бывают абсолютно согласованными. Для оценки влияния несогласованности на точность измерения разработаны теории надёжности тестов. Основной отправной точкой для почти всех теорий надёжности тестов является идея о том, что результаты тестов отражают влияние двух типов факторов:

1. Средняя ошибка измерения = 0

2. Истинные баллы и ошибки некоррелированы

3. Ошибки в разных измерениях некоррелированы

Теория надёжности показывает, что дисперсия полученных баллов равна сумме дисперсии истинных баллов и дисперсии ошибок измерения. Альфа Кронбаха является обобщением более ранней формы оценки внутренней согласованности – формулы Кудера-Ричардсона 20. Эти показатели надёжности различаются по чувствительности к различным источникам ошибок и, следовательно, не обязаны быть равными. Кроме того, надёжность является свойством баллов измерения, а не самого инструмента измерения, и поэтому считается зависящей от выборки. Оценки надёжности, полученные на одной выборке, могут отличаться от оценок, полученных на другой выборке (помимо того, что можно ожидать из-за вариаций выборки), если вторая выборка сформирована из другой генеральной совокупности, поскольку истинная изменчивость в этой второй генеральной совокупности отличается. (Это справедливо для любых измерений: например, мерные палки могут хорошо измерять дома, но иметь низкую надёжность при измерении длины насекомых.) Надёжность можно повысить за счёт ясности формулировок (для письменных заданий), увеличения объёма инструмента измерения и других неформальных методов. Однако формальный психометрический анализ, называемый анализом заданий, считается наиболее эффективным способом повышения надёжности. Этот анализ включает в себя вычисление сложности заданий и индексов дискриминации заданий, последний из которых предполагает вычисление корреляций между заданиями и суммой баллов по всем заданиям теста. Если задания, которые слишком сложны, слишком просты и/или имеют близкую к нулю или отрицательную дискриминацию, заменяются более качественными заданиями, надёжность инструмента измерения возрастёт. где – показатель неуспешности.