Введение
Психометрическая модель для анализа категориальных данных. Модель Раша, названная в честь Георга Раша, – это психометрическая модель для анализа категориальных данных, таких как ответы на вопросы при оценке чтения или ответы в анкетах, как функция соотношения между способностями, установками или личностными характеристиками респондента и сложностью вопроса. Например, её можно использовать для оценки уровня чтения учащегося или степени выраженности отношения человека к смертной казни на основе ответов в анкете. Помимо психометрии и образовательных исследований, модель Раша и её расширения применяются в других областях, включая здравоохранение, сельское хозяйство и маркетинговые исследования. Математическая теория, лежащая в основе моделей Раша, является частным случаем теории отклика на предметы. Однако существуют важные различия в интерпретации параметров модели и её философских следствиях, которые отличают сторонников модели Раша от традиционного подхода к моделированию отклика на предметы. Ключевым аспектом этого различия является роль специфической объективности – определяющего свойства модели Раша по мнению Георга Раша – как необходимого условия для успешного измерения.
The Rasch model, named after Georg Rasch, is a psychometric model for analyzing categorical data, such as answers to questions on a reading assessment or questionnaire responses, as a function of the trade off between the respondent's abilities, attitudes, or personality traits, and the item difficulty. For example, they may be used to estimate a student's reading ability or the extremity of a person's attitude to capital punishment from responses on a questionnaire. In addition to psychometrics and educational research, the Rasch model and its extensions are used in other areas, including the health profession, agriculture, and market research. The mathematical theory underlying Rasch models is a special case of item response theory. However, there are important differences in the interpretation of the model parameters and its philosophical implications that separate proponents of the Rasch model from the item response modeling tradition. A central aspect of this divide relates to the role of specific objectivity, a defining property of the Rasch model according to Georg Rasch, as a requirement for successful measurement.
Модель Раша для измерения
В модели Раша вероятность конкретного ответа (например, правильного/неправильного ответа) моделируется как функция параметров испытуемого и задания. В оригинальной модели Раша вероятность правильного ответа моделируется как логистическая функция разности между параметром испытуемого и параметром задания. Математическая форма модели приведена далее в этой статье. В большинстве случаев параметры модели характеризуют уровень подготовленности испытуемых и сложность заданий как позиции на непрерывной латентной переменной. Например, в образовательных тестах параметры заданий представляют сложность заданий, а параметры испытуемых представляют способность или уровень достижений оцениваемых людей. Чем выше способность испытуемого по отношению к сложности задания, тем выше вероятность правильного ответа на это задание. Когда позиция испытуемого на латентной черте равна сложности задания, по определению в модели Раша вероятность правильного ответа равна 0,5. Модель Раша является моделью в том смысле, что она представляет структуру, которую данные должны демонстрировать для получения измерений из этих данных; то есть она предоставляет критерий успешного измерения. Помимо данных, уравнения Раша моделируют взаимосвязи, которые мы ожидаем наблюдать в реальном мире. Например, образование должно готовить детей ко всему спектру задач, с которыми они столкнутся в жизни, а не только к тем, которые встречаются в учебниках или на тестах. Требуя, чтобы измерения оставались одинаковыми (инвариантными) в разных тестах, измеряющих одно и то же, модели Раша позволяют проверить гипотезу о том, что конкретные задачи, представленные в учебной программе и на тесте, последовательно отражают бесконечную совокупность всех возможных задач в данной области. Следовательно, модель Раша – это модель в смысле идеала или стандарта, который предоставляет эвристическую фикцию, служащую полезным организующим принципом, даже если она никогда не наблюдается на практике. Перспектива или парадигма, лежащая в основе модели Раша, отличается от перспективы, лежащей в основе статистического моделирования. Модели чаще всего используются с целью описания набора данных. Параметры модифицируются и принимаются или отклоняются в зависимости от того, насколько хорошо они соответствуют данным. В отличие от этого, при использовании модели Раша цель состоит в получении данных, которые соответствуют модели. Обоснование этой перспективы заключается в том, что модель Раша воплощает требования, которые должны быть выполнены для получения измерения, в том смысле, в котором измерение обычно понимается в естественных науках. Полезная аналогия для понимания этого обоснования – рассмотреть объекты, измеряемые на весах. Предположим, что вес объекта А измерен как существенно больший, чем вес объекта В в один момент времени, а затем сразу после этого вес объекта В измерен как существенно больший, чем вес объекта А. Свойство, которое мы требуем от измерений, заключается в том, что полученное сравнение между объектами должно быть одинаковым или инвариантным, независимо от других факторов. Это ключевое требование воплощено в формальной структуре модели Раша. Следовательно, модель Раша не изменяется в соответствии с данными. Вместо этого следует изменить метод оценки, чтобы это требование было выполнено, так же, как весы следует отремонтировать, если они дают разные сравнения между объектами при отдельных измерениях. Данные, анализируемые с использованием модели, обычно являются ответами на стандартные задания в тестах, например, на образовательные тесты с правильными/неправильными ответами. Однако модель является общей и может применяться везде, где получаются дискретные данные с целью измерения количественного атрибута или черты.
Масштабирование
Когда все тестируемые имеют возможность выполнить все задания в одном тесте, каждый итоговый балл соответствует уникальной оценке уровня подготовки, и чем выше итоговый балл, тем выше оценка уровня подготовки. Итоговые баллы не имеют линейной зависимости от оценок уровня подготовки. Скорее, эта зависимость нелинейная, как показано на рисунке 1. Итоговый балл представлен на вертикальной оси, а оценка местоположения испытуемого – на горизонтальной оси. Для конкретного теста, на основе которого построена кривая характеристик теста (TCC), показанная на рисунке 1, зависимость примерно линейна в диапазоне итоговых баллов от 13 до 31. Форма TCC обычно несколько сигмоидальна, как в данном примере. Однако точная взаимосвязь между итоговыми баллами и оценками местоположения испытуемого зависит от распределения заданий в тесте. TCC более крутая в диапазонах континуума, где представлено больше заданий, например, в диапазоне по обе стороны от 0 на рисунках 1 и 2. При применении модели Раша местоположения заданий часто масштабируются в первую очередь, используя методы, описанные ниже. Эта часть процесса масштабирования часто называется калибровкой заданий. В образовательных тестах чем меньше доля правильных ответов, тем выше сложность задания и, следовательно, тем выше его местоположение в шкале. После масштабирования местоположений заданий местоположения испытуемых измеряются в той же шкале. В результате местоположения испытуемых и заданий оцениваются по единой шкале, как показано на рисунке 2.
Интерпретация мест масштаба
Для дихотомических данных, таких как правильные/неправильные ответы, по определению, положение элемента на шкале соответствует положению человека, при котором существует вероятность 0,5 правильного ответа на вопрос. В общем случае, вероятность того, что человек правильно ответит на вопрос с уровнем сложности ниже, чем его собственный уровень, больше 0,5, а вероятность правильно ответить на вопрос с уровнем сложности выше его уровня – меньше 0,5. Кривая характеристик элемента (ICC) или функция отклика элемента (IRF) показывает вероятность правильного ответа как функцию способности испытуемого. Один пример ICC представлен и более подробно объяснен в связи с рисунком 4 в данной статье (см. также функцию отклика элемента). Самые левые ICC на рисунке 3 соответствуют самым простым элементам, а самые правые ICC на том же рисунке – самым сложным элементам. Когда ответы испытуемого упорядочены по сложности элементов, от самых простых к самым сложным, наиболее вероятным паттерном является паттерн или вектор Гаттмана, то есть {1,1, ,1,0,0,0, ,0}. Однако, хотя этот паттерн наиболее вероятен, учитывая структуру модели Раша, модель требует лишь вероятностных паттернов отклика Гаттмана, то есть паттернов, стремящихся к паттерну Гаттмана. Строгое соответствие паттерну встречается редко, поскольку существует множество возможных паттернов. Для соответствия данных модели Раша не требуется строгого соответствия паттерну. Каждая оценка способности связана со стандартной ошибкой измерения, которая количественно определяет степень неопределенности, связанной с этой оценкой. Оценки элементов также имеют стандартные ошибки. Как правило, стандартные ошибки оценок элементов значительно меньше, чем стандартные ошибки оценок испытуемых, поскольку для элемента обычно имеется больше данных об ответах, чем для испытуемого. То есть, число испытуемых, ответивших на данный элемент, обычно больше, чем число элементов, на которые ответил данный испытуемый. Стандартные ошибки оценок испытуемых меньше, когда наклон ICC более крутой, что обычно наблюдается в среднем диапазоне баллов теста. Таким образом, в этом диапазоне достигается большая точность, поскольку чем круче наклон, тем больше различие между любыми двумя точками на линии. Статистические и графические тесты используются для оценки соответствия данных модели. Некоторые тесты являются глобальными, а другие фокусируются на конкретных элементах или испытуемых. Некоторые тесты на соответствие предоставляют информацию о том, какие элементы можно использовать для повышения надежности теста путем исключения или исправления проблемных элементов. В измерении Раша вместо индексов надежности используется индекс разделения испытуемых. Однако индекс разделения испытуемых аналогичен индексу надежности. Индекс разделения представляет собой отношение истинного разделения к разделению с учетом ошибки измерения. Как упоминалось ранее, уровень ошибки измерения не является равномерным по всему диапазону теста, но обычно выше для крайних значений (низких и высоких).
Неизменное сравнение и достаточность
Модель Раша для дихотомических данных часто рассматривается как модель теории ответа элемента (IRT) с одним параметром элемента. Однако, вместо того чтобы быть конкретной моделью IRT, сторонники модели рассматривают ее как модель, обладающую свойством, которое отличает ее от других моделей IRT. В частности, определяющим свойством моделей Раша является их формальное или математическое воплощение принципа инвариантного сравнения. Раш обобщил принцип инвариантного сравнения следующим образом: сравнение между двумя стимулами должно быть независимым от того, какие конкретные испытуемые были вовлечены в сравнение, и также должно быть независимым от того, какие другие стимулы в рассматриваемом классе были или могли быть сопоставлены. Симметрично, сравнение между двумя испытуемыми должно быть независимым от того, какие конкретные стимулы в рассматриваемом классе были использованы для сравнения, и также должно быть независимым от того, были ли сравнивались другие испытуемые в том же или другом случае. Модели Раша воплощают этот принцип, поскольку их формальная структура позволяет алгебраически разделить параметры испытуемого и элемента, в том смысле, что параметр испытуемого может быть исключен в процессе статистической оценки параметров элемента. Этот результат достигается с помощью оценки максимального правдоподобия при условии, в которой пространство ответов разделяется в соответствии с общими баллами испытуемого. Следовательно, исходный балл для элемента или испытуемого является достаточной статистикой для параметра элемента или испытуемого. То есть, общий балл испытуемого содержит всю информацию, доступную в данном контексте об испытуемом, а общий балл элемента содержит всю информацию относительно элемента, в отношении соответствующей латентной черты. Модель Раша требует определенной структуры в данных ответа, а именно вероятностной структуры Гаттмана. В несколько более понятных терминах, модели Раша предоставляют основу и обоснование для определения местоположения испытуемого на континууме на основе общих баллов, полученных при оценке. Хотя не редко считать общие баллы непосредственными измерениями, на самом деле они представляют собой подсчет дискретных наблюдений, а не измерения. Каждое наблюдение представляет собой наблюдаемый результат сравнения между испытуемым и элементом. Такие результаты прямо аналогичны наблюдению за наклоном рычажных весов в ту или иную сторону. Это наблюдение указывает на то, что один из объектов имеет большую массу, но подсчет таких наблюдений нельзя рассматривать непосредственно как измерения. Раш указал, что принцип инвариантного сравнения характерен для измерений в физике, приводя в качестве примера двухстороннюю экспериментальную систему отсчета, в которой каждый инструмент оказывает механическое воздействие на твердые тела для создания ускорения. Таким образом, условное логарифмическое отношение шансов не включает параметр испытуемого, который, следовательно, может быть исключен путем обусловленности общим баллом. То есть, разделяя ответы в соответствии с исходными баллами и вычисляя логарифмическое отношение шансов правильного ответа, получается оценка без участия . В более общем плане, ряд параметров элементов может быть оценен итеративно с помощью процесса, такого как оценка условного максимального правдоподобия (см. Оценка модели Раша). Хотя это более сложно, тот же основополагающий принцип применяется в таких оценках. ICC модели Раша для дихотомических данных показана на рисунке 4. Серая линия отображает вероятность дискретного исхода (то есть правильного ответа на вопрос) для испытуемых с разными местоположениями на латентном континууме (то есть их уровнем способностей). Местоположение элемента, по определению, является тем местоположением, в котором вероятность того, что , равна 0,5. На рисунке 4 черные круги представляют собой фактические или наблюдаемые пропорции испытуемых в классовых интервалах, для которых был наблюдаем исход. Например, в случае оценочного инструмента, используемого в контексте педагогической психологии, это может быть пропорция испытуемых, которые правильно ответили на вопрос. Испытуемые упорядочены по оценкам их местоположения на латентном континууме и классифицированы на основе этого в классовые интервалы, чтобы графически проверить соответствие наблюдений модели. Наблюдается тесное соответствие данных модели. В дополнение к графической проверке данных используется ряд статистических тестов на соответствие, чтобы оценить, можно ли объяснить отклонения наблюдений от модели только случайными эффектами, как того требует модель, или существуют ли систематические отклонения от модели.
The comparison between two stimuli should be independent of which particular individuals were instrumental for the comparison; and it should also be independent of which other stimuli within the considered class were or might also have been compared. Symmetrically, a comparison between two individuals should be independent of which particular stimuli within the class considered were instrumental for the comparison; and it should also be independent of which other individuals were also compared, on the same or some other occasion. Rasch models embody this principle because their formal structure permits algebraic separation of the person and item parameters, in the sense that the person parameter can be eliminated during the process of statistical estimation of item parameters. This result is achieved through the use of conditional maximum likelihood estimation, in which the response space is partitioned according to person total scores. The consequence is that the raw score for an item or person is the sufficient statistic for the item or person parameter. That is to say, the person total score contains all information available within the specified context about the individual, and the item total score contains all information with respect to item, with regard to the relevant latent trait. The Rasch model requires a specific structure in the response data, namely a probabilistic Guttman structure. In somewhat more familiar terms, Rasch models provide a basis and justification for obtaining person locations on a continuum from total scores on assessments. Although it is not uncommon to treat total scores directly as measurements, they are actually counts of discrete observations rather than measurements. Each observation represents the observable outcome of a comparison between a person and item. Such outcomes are directly analogous to the observation of the tipping of a beam balance in one direction or another. This observation would indicate that one or other object has a greater mass, but counts of such observations cannot be treated directly as measurements. Rasch pointed out that the principle of invariant comparison is characteristic of measurement in physics using, by way of example, a two way experimental frame of reference in which each instrument exerts a mechanical force upon solid bodies to produce acceleration. Rasch Hence, the conditional log odds does not involve the person parameter , which can therefore be eliminated by conditioning on the total score That is, by partitioning the responses according to raw scores and calculating the log odds of a correct response, an estimate is obtained without involvement of More generally, a number of item parameters can be estimated iteratively through application of a process such as Conditional Maximum Likelihood estimation (see Rasch model estimation). While more involved, the same fundamental principle applies in such estimations. The ICC of the Rasch model for dichotomous data is shown in Figure 4. The grey line maps the probability of the discrete outcome (that is, correctly answering the question) for persons with different locations on the latent continuum (that is, their level of abilities). The location of an item is, by definition, that location at which the probability that is equal to 0.5. In figure 4, the black circles represent the actual or observed proportions of persons within Class Intervals for which the outcome was observed. For example, in the case of an assessment item used in the context of educational psychology, these could represent the proportions of persons who answered the item correctly. Persons are ordered by the estimates of their locations on the latent continuum and classified into Class Intervals on this basis in order to graphically inspect the accordance of observations with the model. There is a close conformity of the data with the model. In addition to graphical inspection of data, a range of statistical tests of fit are used to evaluate whether departures of observations from the model can be attributed to random effects alone, as required, or whether there are systematic departures from the model.
Политомические расширения модели Раша
Существует несколько политомических расширений модели Раша, которые обобщают дихотомическую модель, позволяя применять её в ситуациях, где последовательные целые баллы отражают категории возрастающего уровня или величины латентной черты, такие как возрастающая способность, двигательные функции, согласие с утверждением и тому подобное. Эти политомические расширения, например, могут быть использованы при работе со шкалами Ликерта, при выставлении оценок в образовательной практике и при оценке выступлений судьями.
Другие соображения
Критикой модели Раша является то, что она излишне ограничительна или предписывает определенные рамки, поскольку одним из предположений модели является равенство дискриминации всех заданий, в то время как на практике дискриминация заданий варьируется, и, следовательно, ни один набор данных не продемонстрирует идеального соответствия модели. Распространенное заблуждение заключается в том, что модель Раша не допускает различной дискриминации для каждого задания, однако равная дискриминация является предположением инвариантного измерения, поэтому различающаяся дискриминация заданий не запрещена, а скорее указывает на то, что качество измерения не соответствует теоретическому идеалу. Подобно физическим измерениям, реальные наборы данных никогда не будут идеально соответствовать теоретическим моделям, поэтому важным вопросом является то, обеспечивает ли конкретный набор данных достаточную точность измерения для поставленной задачи, а не то, соответствует ли он недостижимому стандарту совершенства. Критика, специфичная для использования модели Раша с данными ответов на задания с множественным выбором, заключается в отсутствии в модели учета возможности угадывания, поскольку левая асимптота всегда стремится к нулевой вероятности. Это подразумевает, что человек с низким уровнем способностей всегда будет давать неправильный ответ. Однако, испытуемые с низким уровнем способностей, выполняющие тест с множественным выбором, имеют значительно более высокую вероятность выбора правильного ответа случайно (для задания с k вариантами вероятность составляет около 1/k). Трехпараметрическая логистическая модель снимает оба этих ограничения, а двухпараметрическая логистическая модель допускает переменную крутизну. Однако, спецификация однородной дискриминации и нулевой левой асимптоты являются необходимыми свойствами модели для обеспечения достаточности простой, не взвешенной суммарной оценки. На практике, ненулевая нижняя асимптота, обнаруживаемая в наборах данных с множественным выбором, представляет меньшую угрозу для точности измерения, чем обычно предполагается, и обычно не приводит к существенным ошибкам измерения при разумном использовании хорошо разработанных тестовых заданий. Verhelst & Glas (1995) выводят уравнения условного максимального правдоподобия (CML) для модели, которую они называют однопараметрической логистической моделью (OPLM). В алгебраической форме она идентична модели 2PL, но OPLM содержит заданные заранее индексы дискриминации, а не оцениваемые параметры дискриминации 2PL. Однако, как отмечают эти авторы, проблема, возникающая при оценке с использованием оцениваемых параметров дискриминации, заключается в том, что значения дискриминации неизвестны, что означает, что взвешенная суммарная оценка "не является простой статистикой и, следовательно, невозможно использовать CML в качестве метода оценки". То есть, достаточность взвешенной "оценки" в 2PL не может быть использована в соответствии с определением достаточной статистики. Если веса задаются, а не оцениваются, как в OPLM, возможна условная оценка, и некоторые свойства модели Раша сохраняются. Известными сторонниками моделей Раша являются Бенджамин Дрейк Райт, Дэвид Андрич и Эрлинг Андерсен.
Verhelst & Glas (1995) derive Conditional Maximum Likelihood (CML) equations for a model they refer to as the One Parameter Logistic Model (OPLM). In algebraic form it appears to be identical with the 2PL model, but OPLM contains preset discrimination indexes rather than 2PL's estimated discrimination parameters. As noted by these authors, though, the problem one faces in estimation with estimated discrimination parameters is that the discriminations are unknown, meaning that the weighted raw score "is not a mere statistic, and hence it is impossible to use CML as an estimation method". That is, sufficiency of the weighted "score" in the 2PL cannot be used according to the way in which a sufficient statistic is defined. If the weights are imputed instead of being estimated, as in OPLM, conditional estimation is possible and some of the properties of the Rasch model are retained. Prominent advocates of Rasch models include Benjamin Drake Wright, David Andrich and Erling Andersen.