Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Общая согласованность измерения в статистике и психометрии
Overall consistency of a measure in statistics and psychometrics
В статистике и психометрии надежность – это общая согласованность измерения. Измерение считается обладающим высокой надежностью, если оно дает схожие результаты при одинаковых условиях: «Это характеристика набора тестовых баллов, отражающая величину случайной ошибки, возникающей в процессе измерения и потенциально влияющей на баллы. Баллы с высокой надежностью точны, воспроизводимы и стабильны при повторном тестировании. То есть, если бы процесс тестирования был повторен с той же группой испытуемых, были бы получены практически идентичные результаты. Для оценки величины ошибки в баллах обычно используются различные коэффициенты надежности, значения которых варьируются от 0,00 (большая ошибка) до 1,00 (отсутствие ошибки). Например, измерения роста и веса людей часто отличаются очень высокой надежностью.»
In statistics and psychometrics, reliability is the overall consistency of a measure. A measure is said to have a high reliability if it produces similar results under consistent conditions:"It is the characteristic of a set of test scores that relates to the amount of random error from the measurement process that might be embedded in the scores. Scores that are highly reliable are precise, reproducible, and consistent from one testing occasion to another. That is, if the testing process were repeated with a group of test takers, essentially the same results would be obtained. Various kinds of reliability coefficients, with values ranging between 0.00 (much error) and 1.00 (no error), are usually used to indicate the amount of error in the scores." For example, measurements of people's height and weight are often extremely reliable.
Общая модель
На практике, методы тестирования никогда не бывают абсолютно согласованными. Для оценки влияния несогласованности на точность измерения разработаны теории надёжности тестов. Основной отправной точкой для почти всех теорий надёжности тестов является идея о том, что результаты тестов отражают влияние двух типов факторов:
In practice, testing measures are never perfectly consistent. Theories of test reliability have been developed to estimate the effects of inconsistency on the accuracy of measurement. The basic starting point for almost all theories of test reliability is the idea that test scores reflect the influence of two sorts of factors:
1. Средняя ошибка измерения = 0
1. Mean error of measurement = 0
2. Истинные баллы и ошибки некоррелированы
2. True scores and errors are uncorrelated
3. Ошибки в разных измерениях некоррелированы
3. Errors on different measures are uncorrelated
Теория надёжности показывает, что дисперсия полученных баллов равна сумме дисперсии истинных баллов и дисперсии ошибок измерения. Альфа Кронбаха является обобщением более ранней формы оценки внутренней согласованности – формулы Кудера-Ричардсона 20. Эти показатели надёжности различаются по чувствительности к различным источникам ошибок и, следовательно, не обязаны быть равными. Кроме того, надёжность является свойством баллов измерения, а не самого инструмента измерения, и поэтому считается зависящей от выборки. Оценки надёжности, полученные на одной выборке, могут отличаться от оценок, полученных на другой выборке (помимо того, что можно ожидать из-за вариаций выборки), если вторая выборка сформирована из другой генеральной совокупности, поскольку истинная изменчивость в этой второй генеральной совокупности отличается. (Это справедливо для любых измерений: например, мерные палки могут хорошо измерять дома, но иметь низкую надёжность при измерении длины насекомых.) Надёжность можно повысить за счёт ясности формулировок (для письменных заданий), увеличения объёма инструмента измерения и других неформальных методов. Однако формальный психометрический анализ, называемый анализом заданий, считается наиболее эффективным способом повышения надёжности. Этот анализ включает в себя вычисление сложности заданий и индексов дискриминации заданий, последний из которых предполагает вычисление корреляций между заданиями и суммой баллов по всем заданиям теста. Если задания, которые слишком сложны, слишком просты и/или имеют близкую к нулю или отрицательную дискриминацию, заменяются более качественными заданиями, надёжность инструмента измерения возрастёт. где – показатель неуспешности.
Reliability theory shows that the variance of obtained scores is simply the sum of the variance of true scores plus the variance of errors of measurement. Cronbach's alpha is a generalization of an earlier form of estimating internal consistency, Kuder–Richardson Formula 20. These measures of reliability differ in their sensitivity to different sources of error and so need not be equal. Also, reliability is a property of the scores of a measure rather than the measure itself and are thus said to be sample dependent. Reliability estimates from one sample might differ from those of a second sample (beyond what might be expected due to sampling variations) if the second sample is drawn from a different population because the true variability is different in this second population. (This is true of measures of all types—yardsticks might measure houses well yet have poor reliability when used to measure the lengths of insects.) Reliability may be improved by clarity of expression (for written assessments), lengthening the measure, and other informal means. However, formal psychometric analysis, called item analysis, is considered the most effective way to increase reliability. This analysis consists of computation of item difficulties and item discrimination indices, the latter index involving computation of correlations between the items and sum of the item scores of the entire test. If items that are too difficult, too easy, and/or have near zero or negative discrimination are replaced with better items, the reliability of the measure will increase. where is the failure rate.