Введение
Форма компьютерного тестирования, адаптирующаяся к уровню подготовки тестируемого. Компьютеризированное адаптивное тестирование (CAT) – это форма компьютерного тестирования, которая адаптируется к уровню способностей экзаменуемого. По этой причине его также называют тестированием с индивидуальным подбором заданий. Иными словами, это форма компьютерного тестирования, в которой следующий вопрос или набор вопросов, предлагаемых тестируемому, зависит от правильности его ответов на предыдущие вопросы.
Computerized adaptive testing (CAT) is a form of computer based test that adapts to the examinee's ability level. For this reason, it has also been called tailored testing. In other words, it is a form of computer administered test in which the next item or set of items selected to be administered depends on the correctness of the test taker's responses to the most recent items administered.
Преимущества
Адаптивные тесты могут обеспечивать равномерно точные баллы для большинства тестируемых. Все задания должны быть предварительно протестированы на достаточно большой выборке для получения стабильной статистики заданий. Эта выборка может составлять до 1000 испытуемых. В силу своей сложности, разработка КАТ требует ряда предварительных условий. Необходимо наличие больших выборок (обычно сотни испытуемых), требуемых для калибровки по теории отклика на задачу (IRT). Задания должны оцениваться в режиме реального времени, если новый вопрос должен быть выбран мгновенно. Для обеспечения обоснования валидности необходимы психометрики, имеющие опыт работы с калибровкой IRT и моделированием КАТ. Наконец, должна быть доступна программная система, способная к реализации КАТ на основе истинной IRT. В КАТ с ограничением времени тестируемый не может точно спланировать время, которое он может потратить на каждый вопрос, и определить, успевает ли он выполнить раздел теста в отведенное время. Таким образом, тестируемые могут быть наказаны за то, что тратят слишком много времени на сложный вопрос, представленный в начале раздела, и в результате не успевают ответить на достаточное количество вопросов, чтобы точно оценить свой уровень знаний в областях, которые остаются непроверенными по истечении времени. В то время как КАТ без ограничения времени являются отличным инструментом для формирующего оценивания, направляющего дальнейшее обучение, КАТ с ограничением времени не подходят для итогового оценивания с высокими ставками, используемого для измерения способностей при приеме на работу и поступлении в образовательные программы.
Провалился
Во многих ситуациях целью тестирования является классификация испытуемых в две или более взаимоисключающих и исчерпывающих категорий. Это включает в себя распространенный "тест на освоение", где предусмотрены две классификации – "сдал" и "не сдал", но также и ситуации с тремя или более классификациями, такие как уровни знаний или компетентности: "недостаточный", "базовый" и "продвинутый". Тип "адаптивного тестирования по уровню сложности" CAT, описанный в этой статье, наиболее подходит для тестов, которые не являются "сдал/не сдал", или для тестов "сдал/не сдал", где предоставление качественной обратной связи особенно важно. Для тестов "сдал/не сдал", также известных как компьютерные классификационные тесты (CCT), необходимы некоторые модификации. В этом случае задача классификации испытуемого формулируется как проверка гипотезы о том, что способность испытуемого равна определенной точке выше порогового балла или другой определенной точке ниже порогового балла. Следует отметить, что это формулировка точечной гипотезы, а не композитной гипотезы, которая была бы более концептуально обоснованной. Композитная гипотеза заключалась бы в том, что способность испытуемого находится в диапазоне выше порогового балла или в диапазоне ниже порогового балла. Также используется подход с доверительным интервалом, когда после каждого вопроса алгоритм определяет вероятность того, что истинный балл испытуемого выше или ниже порогового балла. Например, алгоритм может продолжаться до тех пор, пока 95% доверительный интервал для истинного балла больше не будет содержать пороговый балл. В этом случае дальнейшие вопросы не требуются, поскольку решение о сдаче/не сдаче уже на 95% точно, при условии, что психометрические модели, лежащие в основе адаптивного тестирования, соответствуют испытуемому и тесту. Изначально этот подход назывался "адаптивным тестированием на освоение". Максимизация информации при оценке способности более уместна для подхода с доверительным интервалом, поскольку она минимизирует условную стандартную ошибку измерения, что уменьшает ширину доверительного интервала, необходимого для классификации. В этом подходе генерируется случайное число из U(0,1) и сравнивается с параметром ki, определяемым для каждого вопроса разработчиком теста. Если случайное число больше ki, рассматривается следующий наиболее информативный вопрос. Была предложена альтернативная методика, называемая "теневым тестированием", которая включает создание целых наборов запасных вопросов при выборе вопросов для теста. Выбор вопросов из запасных наборов помогает адаптивным тестам соответствовать критериям отбора, ориентируясь на глобально оптимальные варианты (в отличие от вариантов, оптимальных для конкретного вопроса).
Многомерная
При наличии набора заданий многомерный компьютерный адаптивный тест (MCAT) отбирает задания из банка в соответствии с оцененными способностями испытуемого, формируя индивидуализированный тест. MCAT стремится максимизировать точность теста, основываясь на одновременной оценке нескольких способностей (в отличие от компьютерного адаптивного теста – CAT, который оценивает только одну способность), используя последовательность ранее отвеченных заданий (Piton Gonçalves & Aluisio, 2012).
Дополнительные источники
Драсгоу, Ф., и Олсон Бьюкенен, Дж. Б. (Ред.). (1999). Инновации в компьютерном оценивании. Хиллсдейл, Нью-Джерси: Эрлбаум. Питон Гонсалвес, Ж. & Алуисио, С. М. (2012). Архитектура для многомерного адаптивного компьютерного тестирования с образовательными целями. ACM, Нью-Йорк, Нью-Йорк, США, 17–24. Питон Гонсалвес, Ж. (2020). Адаптивные тесты для Enade: методологическое применение. Meta: Avaliação, 12(36):665–688. Ван дер Линден, В. Дж., и Глас, К. А. В. (Ред.). (2000). Компьютерное адаптивное тестирование: теория и практика. Бостон, Массачусетс: Клювер. Уэйнер, Х. (Ред.). (2000). Компьютерное адаптивное тестирование: руководство (2-е изд.). Махва, Нью-Джерси: Lawrence Erlbaum Associates. Вайс, Д. Дж. (Ред.). (1983). Новые горизонты в тестировании: теория латентных признаков и компьютеризированное адаптивное тестирование (с. 237–254). Нью-Йорк: Academic Press.
Van der Linden, W. J., & Glas, C. A. W. (Eds.). (2000). Computerized adaptive testing: Theory and practice. Boston, MA: Kluwer. Wainer, H. (Ed.). (2000). Computerized adaptive testing: A Primer (2nd Edition). Mahwah, NJ: ELawrence Erlbaum Associates. Weiss, D. J. (Ed.). (1983). New horizons in testing: Latent trait theory and computerized adaptive testing (pp. 237–254). New York: Academic Press.