Введение
Классическая теория тестов (CTT) – это совокупность взаимосвязанных психометрических теорий, предсказывающих результаты психологического тестирования, такие как сложность заданий или способности испытуемых. Это теория тестирования, основанная на представлении о том, что наблюдаемый или полученный балл испытуемого является суммой истинного балла (балла, свободного от ошибок) и балла ошибки. В общем, целью классической теории тестов является понимание и повышение надежности психологических тестов. Классическую теорию тестов можно рассматривать как приблизительный синоним теории истинного балла. Термин «классическая» относится не только к хронологии этих моделей, но и противопоставляется более поздним психометрическим теориям, обычно объединяемым под названием теория отклика на задачу, которые иногда называют «современными», например, «современная теория скрытых признаков». Классическая теория тестов в том виде, в котором мы знаем ее сегодня, была систематизирована Новиком (1966) и описана в классических работах, таких как Lord & Novick (1968) и Allen & Yen (1979/2002). Описание классической теории тестов, представленное ниже, основано на этих основополагающих публикациях.
Оценочные позиции: корреляции P и суммы позиций
Надежность предоставляет удобный показатель качества теста в виде одного числа – коэффициента надежности. Однако она не дает никакой информации для оценки отдельных вопросов. Анализ вопросов в рамках классического подхода часто опирается на две статистики: значение P (доля) и корреляция вопроса с общим баллом (коэффициент корреляции бисериального ранга). Значение P представляет собой долю экзаменуемых, выбравших правильный ответ, и обычно называется сложностью вопроса. Корреляция вопроса с общим баллом предоставляет показатель различительной способности вопроса, и обычно называется дискриминацией вопроса. Кроме того, эти статистики рассчитываются для каждого варианта ответа в часто используемых вопросах с множественным выбором, что позволяет оценить вопросы и выявить возможные проблемы, такие как запутывающий отвлекающий вариант. Такой ценный анализ обеспечивается специализированным психометрическим программным обеспечением.
Альтернативы
Классическая теория тестов – влиятельная теория оценок тестов в социальных науках. В психометрии эта теория была вытеснена более сложными моделями теории отклика на задачу (IRT) и теории обобщаемости (G-теории). Однако IRT не включена в стандартные статистические пакеты, такие как SPSS, в то время как SAS может оценивать модели IRT с помощью PROC IRT и PROC MCMC, а также существуют пакеты IRT для языка статистического программирования R с открытым исходным кодом (например, CTT). Хотя коммерческие пакеты обычно предоставляют оценки коэффициента Кронбаха, для IRT или G-теории может быть предпочтительным специализированное психометрическое программное обеспечение. Однако общие статистические пакеты часто не обеспечивают полного классического анализа (коэффициент Кронбаха – это лишь одна из многих важных статистик), и во многих случаях также требуется специализированное программное обеспечение для классического анализа.
Недостатки
Одним из наиболее важных или известных недостатков классической теории тестирования является то, что характеристики испытуемого и характеристики теста не могут быть разделены: каждая из них может быть интерпретирована только в контексте другой. Другой недостаток заключается в определении надёжности, существующем в классической теории тестов, которое гласит, что надёжность – это «корреляция между результатами тестов на параллельных формах теста». Проблема в том, что существуют различные представления о том, что представляют собой параллельные тесты. Различные коэффициенты надёжности предоставляют либо нижние оценки надёжности, либо оценки надёжности с неизвестными систематическими ошибками. Третий недостаток связан со стандартной ошибкой измерения. Проблема здесь в том, что согласно классической теории тестирования, стандартная ошибка измерения предполагается одинаковой для всех испытуемых. Однако, как объясняет Хамблтон в своей книге, результаты любого теста являются мерой разной точности для испытуемых с разным уровнем подготовки, что делает предположение об одинаковой ошибке измерения для всех испытуемых маловероятным (Hambleton, Swaminathan, Rogers, 1991, p. 4). Четвертый и последний недостаток классической теории тестирования заключается в том, что она ориентирована на тест в целом, а не на отдельные задания. Иными словами, классическая теория тестов не позволяет нам прогнозировать, насколько успешно конкретный испытуемый или группа испытуемых справится с отдельным заданием теста.