Введение

Психометрическая модель для анализа категориальных данных. Модель Раша, названная в честь Георга Раша, – это психометрическая модель для анализа категориальных данных, таких как ответы на вопросы при оценке чтения или ответы в анкетах, как функция соотношения между способностями, установками или личностными характеристиками респондента и сложностью вопроса. Например, её можно использовать для оценки уровня чтения учащегося или степени выраженности отношения человека к смертной казни на основе ответов в анкете. Помимо психометрии и образовательных исследований, модель Раша и её расширения применяются в других областях, включая здравоохранение, сельское хозяйство и маркетинговые исследования. Математическая теория, лежащая в основе моделей Раша, является частным случаем теории отклика на предметы. Однако существуют важные различия в интерпретации параметров модели и её философских следствиях, которые отличают сторонников модели Раша от традиционного подхода к моделированию отклика на предметы. Ключевым аспектом этого различия является роль специфической объективности – определяющего свойства модели Раша по мнению Георга Раша – как необходимого условия для успешного измерения.

Модель Раша для измерения

В модели Раша вероятность конкретного ответа (например, правильного/неправильного ответа) моделируется как функция параметров испытуемого и задания. В оригинальной модели Раша вероятность правильного ответа моделируется как логистическая функция разности между параметром испытуемого и параметром задания. Математическая форма модели приведена далее в этой статье. В большинстве случаев параметры модели характеризуют уровень подготовленности испытуемых и сложность заданий как позиции на непрерывной латентной переменной. Например, в образовательных тестах параметры заданий представляют сложность заданий, а параметры испытуемых представляют способность или уровень достижений оцениваемых людей. Чем выше способность испытуемого по отношению к сложности задания, тем выше вероятность правильного ответа на это задание. Когда позиция испытуемого на латентной черте равна сложности задания, по определению в модели Раша вероятность правильного ответа равна 0,5. Модель Раша является моделью в том смысле, что она представляет структуру, которую данные должны демонстрировать для получения измерений из этих данных; то есть она предоставляет критерий успешного измерения. Помимо данных, уравнения Раша моделируют взаимосвязи, которые мы ожидаем наблюдать в реальном мире. Например, образование должно готовить детей ко всему спектру задач, с которыми они столкнутся в жизни, а не только к тем, которые встречаются в учебниках или на тестах. Требуя, чтобы измерения оставались одинаковыми (инвариантными) в разных тестах, измеряющих одно и то же, модели Раша позволяют проверить гипотезу о том, что конкретные задачи, представленные в учебной программе и на тесте, последовательно отражают бесконечную совокупность всех возможных задач в данной области. Следовательно, модель Раша – это модель в смысле идеала или стандарта, который предоставляет эвристическую фикцию, служащую полезным организующим принципом, даже если она никогда не наблюдается на практике. Перспектива или парадигма, лежащая в основе модели Раша, отличается от перспективы, лежащей в основе статистического моделирования. Модели чаще всего используются с целью описания набора данных. Параметры модифицируются и принимаются или отклоняются в зависимости от того, насколько хорошо они соответствуют данным. В отличие от этого, при использовании модели Раша цель состоит в получении данных, которые соответствуют модели. Обоснование этой перспективы заключается в том, что модель Раша воплощает требования, которые должны быть выполнены для получения измерения, в том смысле, в котором измерение обычно понимается в естественных науках. Полезная аналогия для понимания этого обоснования – рассмотреть объекты, измеряемые на весах. Предположим, что вес объекта А измерен как существенно больший, чем вес объекта В в один момент времени, а затем сразу после этого вес объекта В измерен как существенно больший, чем вес объекта А. Свойство, которое мы требуем от измерений, заключается в том, что полученное сравнение между объектами должно быть одинаковым или инвариантным, независимо от других факторов. Это ключевое требование воплощено в формальной структуре модели Раша. Следовательно, модель Раша не изменяется в соответствии с данными. Вместо этого следует изменить метод оценки, чтобы это требование было выполнено, так же, как весы следует отремонтировать, если они дают разные сравнения между объектами при отдельных измерениях. Данные, анализируемые с использованием модели, обычно являются ответами на стандартные задания в тестах, например, на образовательные тесты с правильными/неправильными ответами. Однако модель является общей и может применяться везде, где получаются дискретные данные с целью измерения количественного атрибута или черты.

Масштабирование

Когда все тестируемые имеют возможность выполнить все задания в одном тесте, каждый итоговый балл соответствует уникальной оценке уровня подготовки, и чем выше итоговый балл, тем выше оценка уровня подготовки. Итоговые баллы не имеют линейной зависимости от оценок уровня подготовки. Скорее, эта зависимость нелинейная, как показано на рисунке 1. Итоговый балл представлен на вертикальной оси, а оценка местоположения испытуемого – на горизонтальной оси. Для конкретного теста, на основе которого построена кривая характеристик теста (TCC), показанная на рисунке 1, зависимость примерно линейна в диапазоне итоговых баллов от 13 до 31. Форма TCC обычно несколько сигмоидальна, как в данном примере. Однако точная взаимосвязь между итоговыми баллами и оценками местоположения испытуемого зависит от распределения заданий в тесте. TCC более крутая в диапазонах континуума, где представлено больше заданий, например, в диапазоне по обе стороны от 0 на рисунках 1 и 2. При применении модели Раша местоположения заданий часто масштабируются в первую очередь, используя методы, описанные ниже. Эта часть процесса масштабирования часто называется калибровкой заданий. В образовательных тестах чем меньше доля правильных ответов, тем выше сложность задания и, следовательно, тем выше его местоположение в шкале. После масштабирования местоположений заданий местоположения испытуемых измеряются в той же шкале. В результате местоположения испытуемых и заданий оцениваются по единой шкале, как показано на рисунке 2.

Интерпретация мест масштаба

Для дихотомических данных, таких как правильные/неправильные ответы, по определению, положение элемента на шкале соответствует положению человека, при котором существует вероятность 0,5 правильного ответа на вопрос. В общем случае, вероятность того, что человек правильно ответит на вопрос с уровнем сложности ниже, чем его собственный уровень, больше 0,5, а вероятность правильно ответить на вопрос с уровнем сложности выше его уровня – меньше 0,5. Кривая характеристик элемента (ICC) или функция отклика элемента (IRF) показывает вероятность правильного ответа как функцию способности испытуемого. Один пример ICC представлен и более подробно объяснен в связи с рисунком 4 в данной статье (см. также функцию отклика элемента). Самые левые ICC на рисунке 3 соответствуют самым простым элементам, а самые правые ICC на том же рисунке – самым сложным элементам. Когда ответы испытуемого упорядочены по сложности элементов, от самых простых к самым сложным, наиболее вероятным паттерном является паттерн или вектор Гаттмана, то есть {1,1, ,1,0,0,0, ,0}. Однако, хотя этот паттерн наиболее вероятен, учитывая структуру модели Раша, модель требует лишь вероятностных паттернов отклика Гаттмана, то есть паттернов, стремящихся к паттерну Гаттмана. Строгое соответствие паттерну встречается редко, поскольку существует множество возможных паттернов. Для соответствия данных модели Раша не требуется строгого соответствия паттерну. Каждая оценка способности связана со стандартной ошибкой измерения, которая количественно определяет степень неопределенности, связанной с этой оценкой. Оценки элементов также имеют стандартные ошибки. Как правило, стандартные ошибки оценок элементов значительно меньше, чем стандартные ошибки оценок испытуемых, поскольку для элемента обычно имеется больше данных об ответах, чем для испытуемого. То есть, число испытуемых, ответивших на данный элемент, обычно больше, чем число элементов, на которые ответил данный испытуемый. Стандартные ошибки оценок испытуемых меньше, когда наклон ICC более крутой, что обычно наблюдается в среднем диапазоне баллов теста. Таким образом, в этом диапазоне достигается большая точность, поскольку чем круче наклон, тем больше различие между любыми двумя точками на линии. Статистические и графические тесты используются для оценки соответствия данных модели. Некоторые тесты являются глобальными, а другие фокусируются на конкретных элементах или испытуемых. Некоторые тесты на соответствие предоставляют информацию о том, какие элементы можно использовать для повышения надежности теста путем исключения или исправления проблемных элементов. В измерении Раша вместо индексов надежности используется индекс разделения испытуемых. Однако индекс разделения испытуемых аналогичен индексу надежности. Индекс разделения представляет собой отношение истинного разделения к разделению с учетом ошибки измерения. Как упоминалось ранее, уровень ошибки измерения не является равномерным по всему диапазону теста, но обычно выше для крайних значений (низких и высоких).

Неизменное сравнение и достаточность

Модель Раша для дихотомических данных часто рассматривается как модель теории ответа элемента (IRT) с одним параметром элемента. Однако, вместо того чтобы быть конкретной моделью IRT, сторонники модели рассматривают ее как модель, обладающую свойством, которое отличает ее от других моделей IRT. В частности, определяющим свойством моделей Раша является их формальное или математическое воплощение принципа инвариантного сравнения. Раш обобщил принцип инвариантного сравнения следующим образом: сравнение между двумя стимулами должно быть независимым от того, какие конкретные испытуемые были вовлечены в сравнение, и также должно быть независимым от того, какие другие стимулы в рассматриваемом классе были или могли быть сопоставлены. Симметрично, сравнение между двумя испытуемыми должно быть независимым от того, какие конкретные стимулы в рассматриваемом классе были использованы для сравнения, и также должно быть независимым от того, были ли сравнивались другие испытуемые в том же или другом случае. Модели Раша воплощают этот принцип, поскольку их формальная структура позволяет алгебраически разделить параметры испытуемого и элемента, в том смысле, что параметр испытуемого может быть исключен в процессе статистической оценки параметров элемента. Этот результат достигается с помощью оценки максимального правдоподобия при условии, в которой пространство ответов разделяется в соответствии с общими баллами испытуемого. Следовательно, исходный балл для элемента или испытуемого является достаточной статистикой для параметра элемента или испытуемого. То есть, общий балл испытуемого содержит всю информацию, доступную в данном контексте об испытуемом, а общий балл элемента содержит всю информацию относительно элемента, в отношении соответствующей латентной черты. Модель Раша требует определенной структуры в данных ответа, а именно вероятностной структуры Гаттмана. В несколько более понятных терминах, модели Раша предоставляют основу и обоснование для определения местоположения испытуемого на континууме на основе общих баллов, полученных при оценке. Хотя не редко считать общие баллы непосредственными измерениями, на самом деле они представляют собой подсчет дискретных наблюдений, а не измерения. Каждое наблюдение представляет собой наблюдаемый результат сравнения между испытуемым и элементом. Такие результаты прямо аналогичны наблюдению за наклоном рычажных весов в ту или иную сторону. Это наблюдение указывает на то, что один из объектов имеет большую массу, но подсчет таких наблюдений нельзя рассматривать непосредственно как измерения. Раш указал, что принцип инвариантного сравнения характерен для измерений в физике, приводя в качестве примера двухстороннюю экспериментальную систему отсчета, в которой каждый инструмент оказывает механическое воздействие на твердые тела для создания ускорения. Таким образом, условное логарифмическое отношение шансов не включает параметр испытуемого, который, следовательно, может быть исключен путем обусловленности общим баллом. То есть, разделяя ответы в соответствии с исходными баллами и вычисляя логарифмическое отношение шансов правильного ответа, получается оценка без участия . В более общем плане, ряд параметров элементов может быть оценен итеративно с помощью процесса, такого как оценка условного максимального правдоподобия (см. Оценка модели Раша). Хотя это более сложно, тот же основополагающий принцип применяется в таких оценках. ICC модели Раша для дихотомических данных показана на рисунке 4. Серая линия отображает вероятность дискретного исхода (то есть правильного ответа на вопрос) для испытуемых с разными местоположениями на латентном континууме (то есть их уровнем способностей). Местоположение элемента, по определению, является тем местоположением, в котором вероятность того, что , равна 0,5. На рисунке 4 черные круги представляют собой фактические или наблюдаемые пропорции испытуемых в классовых интервалах, для которых был наблюдаем исход. Например, в случае оценочного инструмента, используемого в контексте педагогической психологии, это может быть пропорция испытуемых, которые правильно ответили на вопрос. Испытуемые упорядочены по оценкам их местоположения на латентном континууме и классифицированы на основе этого в классовые интервалы, чтобы графически проверить соответствие наблюдений модели. Наблюдается тесное соответствие данных модели. В дополнение к графической проверке данных используется ряд статистических тестов на соответствие, чтобы оценить, можно ли объяснить отклонения наблюдений от модели только случайными эффектами, как того требует модель, или существуют ли систематические отклонения от модели.

Политомические расширения модели Раша

Существует несколько политомических расширений модели Раша, которые обобщают дихотомическую модель, позволяя применять её в ситуациях, где последовательные целые баллы отражают категории возрастающего уровня или величины латентной черты, такие как возрастающая способность, двигательные функции, согласие с утверждением и тому подобное. Эти политомические расширения, например, могут быть использованы при работе со шкалами Ликерта, при выставлении оценок в образовательной практике и при оценке выступлений судьями.

Другие соображения

Критикой модели Раша является то, что она излишне ограничительна или предписывает определенные рамки, поскольку одним из предположений модели является равенство дискриминации всех заданий, в то время как на практике дискриминация заданий варьируется, и, следовательно, ни один набор данных не продемонстрирует идеального соответствия модели. Распространенное заблуждение заключается в том, что модель Раша не допускает различной дискриминации для каждого задания, однако равная дискриминация является предположением инвариантного измерения, поэтому различающаяся дискриминация заданий не запрещена, а скорее указывает на то, что качество измерения не соответствует теоретическому идеалу. Подобно физическим измерениям, реальные наборы данных никогда не будут идеально соответствовать теоретическим моделям, поэтому важным вопросом является то, обеспечивает ли конкретный набор данных достаточную точность измерения для поставленной задачи, а не то, соответствует ли он недостижимому стандарту совершенства. Критика, специфичная для использования модели Раша с данными ответов на задания с множественным выбором, заключается в отсутствии в модели учета возможности угадывания, поскольку левая асимптота всегда стремится к нулевой вероятности. Это подразумевает, что человек с низким уровнем способностей всегда будет давать неправильный ответ. Однако, испытуемые с низким уровнем способностей, выполняющие тест с множественным выбором, имеют значительно более высокую вероятность выбора правильного ответа случайно (для задания с k вариантами вероятность составляет около 1/k). Трехпараметрическая логистическая модель снимает оба этих ограничения, а двухпараметрическая логистическая модель допускает переменную крутизну. Однако, спецификация однородной дискриминации и нулевой левой асимптоты являются необходимыми свойствами модели для обеспечения достаточности простой, не взвешенной суммарной оценки. На практике, ненулевая нижняя асимптота, обнаруживаемая в наборах данных с множественным выбором, представляет меньшую угрозу для точности измерения, чем обычно предполагается, и обычно не приводит к существенным ошибкам измерения при разумном использовании хорошо разработанных тестовых заданий. Verhelst & Glas (1995) выводят уравнения условного максимального правдоподобия (CML) для модели, которую они называют однопараметрической логистической моделью (OPLM). В алгебраической форме она идентична модели 2PL, но OPLM содержит заданные заранее индексы дискриминации, а не оцениваемые параметры дискриминации 2PL. Однако, как отмечают эти авторы, проблема, возникающая при оценке с использованием оцениваемых параметров дискриминации, заключается в том, что значения дискриминации неизвестны, что означает, что взвешенная суммарная оценка "не является простой статистикой и, следовательно, невозможно использовать CML в качестве метода оценки". То есть, достаточность взвешенной "оценки" в 2PL не может быть использована в соответствии с определением достаточной статистики. Если веса задаются, а не оцениваются, как в OPLM, возможна условная оценка, и некоторые свойства модели Раша сохраняются. Известными сторонниками моделей Раша являются Бенджамин Дрейк Райт, Дэвид Андрич и Эрлинг Андерсен.