Введение
Мера репрезентативности индикатора. Конструктная валидность (или конструктивная обоснованность) отражает, насколько хорошо набор индикаторов представляет или отражает концепцию, которую нельзя измерить напрямую. Конструирование валидности – это накопление доказательств в поддержку интерпретации того, что измеряет данный инструмент. Современная теория валидности определяет конструктную валидность как всеобъемлющую проблему валидационного исследования, включающую в себя все другие типы доказательств валидности, такие как валидность содержания и критериальная валидность. Конструктная валидность – это уместность выводов, сделанных на основе наблюдений или измерений (часто баллов тестов), в частности, насколько обоснованно считать, что тест отражает предполагаемый конструкт. Конструкты – это абстракции, которые исследователи намеренно создают для концептуализации латентной переменной, коррелирующей с баллами по данному инструменту (хотя сама переменная непосредственно не наблюдаема). Конструктная валидность исследует вопрос: соответствует ли поведение инструмента теоретическим ожиданиям относительно того, как должен вести себя инструмент, измеряющий данный конструкт? Конструктная валидность имеет решающее значение для общей воспринимаемой валидности теста. Она особенно важна в социальных науках, психологии, психометрии и лингвистических исследованиях. Психологи, такие как Сэмюэл Мессик (1998), выступали за унифицированное понимание конструктной валидности как «интегрированной оценочной суждения о степени, в которой эмпирические данные и теоретическое обоснование подтверждают адекватность и уместность выводов и действий, основанных на результатах тестов». Хотя взгляды Мессика получили распространение в образовательных измерениях и возникли в контексте объяснения валидности в индустрии тестирования, определение, более соответствующее фундаментальным психологическим исследованиям и подкрепленное эмпирическими исследованиями, основанными на данных и подчеркивающими статистические и причинно-следственные рассуждения, было предложено (Borsboom et al., 2004). Ключевую роль в конструктной валидности играют теоретические представления о рассматриваемой черте, то есть концепции, структурирующие понимание аспектов личности, интеллекта и т.д. Пол Мель утверждает: «Наилучший конструкт – это тот, вокруг которого можно построить наибольшее количество выводов наиболее прямым образом».
Construct validity concerns how well a set of indicators represent or reflect a concept that is not directly measurable. Construct validation is the accumulation of evidence to support the interpretation of what a measure reflects. Modern validity theory defines construct validity as the overarching concern of validity research, subsuming all other types of validity evidence such as content validity and criterion validity. Construct validity is the appropriateness of inferences made on the basis of observations or measurements (often test scores), specifically whether a test can reasonably be considered to reflect the intended construct. Constructs are abstractions that are deliberately created by researchers in order to conceptualize the latent variable, which is correlated with scores on a given measure (although it is not directly observable). Construct validity examines the question: Does the measure behave like the theory says a measure of that construct should behave? Construct validity is essential to the perceived overall validity of the test. Construct validity is particularly important in the social sciences, psychology, psychometrics and language studies. Psychologists such as Samuel Messick (1998) have pushed for a unified view of construct validity " as an integrated evaluative judgment of the degree to which empirical evidence and theoretical rationales support the adequacy and appropriateness of inferences and actions based on test scores " While Messick's views are popularized in educational measurement and originated in a career around explaining validity in the context of the testing industry, a definition more in line with foundational psychological research, supported by data driven empirical studies that emphasize statistical and causal reasoning was given by (Borsboom et al., 2004). Key to construct validity are the theoretical ideas behind the trait under consideration, i. e. the concepts that organize how aspects of personality, intelligence, etc. are viewed. Paul Meehl states that, "The best construct is the one around which we can build the greatest number of inferences, in the most direct fashion."
Оценка
Оценка конструктивной валидности требует изучения корреляций измерительного инструмента по отношению к переменным, которые, как известно, связаны с оцениваемым конструктом (который предположительно измеряется оцениваемым инструментом или для которых существуют теоретические основания ожидать связи). Это согласуется с многочертовой многометодной матрицей (МЧММ) оценки конструктивной валидности, описанной в основополагающей работе Кэмпбелла и Фиске (1959). Важно отметить, что одно исследование не подтверждает конструктивную валидность. Скорее, это непрерывный процесс оценки, переоценки, уточнения и развития. Корреляции, соответствующие ожидаемому паттерну, предоставляют доказательства конструктивной валидности. Конструктивная валидность – это суждение, основанное на накоплении корреляций из множества исследований с использованием оцениваемого инструмента. Большинство исследователей стремятся проверить конструктивную валидность перед основным исследованием. Для этого могут использоваться пилотные исследования. Пилотные исследования – это небольшие предварительные исследования, направленные на проверку возможности проведения полномасштабного исследования. Эти пилотные исследования позволяют оценить надежность исследования и внести необходимые корректировки. Другой метод – техника известных групп, которая заключается в применении измерительного инструмента к группам, которые, как ожидается, будут различаться по известным характеристикам. Проверка гипотетических взаимосвязей включает логический анализ, основанный на теории или предыдущих исследованиях.
Конвергентная и дискриминантная валидность
Сходящая и дискриминантная валидность – это два подтипа валидности, составляющие валидность конструкта. Сходящая валидность относится к степени, в которой две оценки конструктов, которые теоретически должны быть связаны, действительно связаны между собой. В отличие от нее, дискриминантная валидность проверяет, действительно ли не связанные между собой концепции или измерения не связаны. Например, рассмотрим конструкт общего счастья. Если оценка общего счастья обладает сходящей валидностью, то конструкты, близкие к счастью (удовлетворенность жизнью, довольство, жизнерадостность и т.д.), должны положительно коррелировать с оценкой общего счастья. Если эта оценка обладает дискриминантной валидностью, то конструкты, которые не должны положительно коррелировать с общим счастьем (печаль, депрессия, отчаяние и т.д.), не должны быть связаны с оценкой общего счастья. Оценки могут обладать одним из подтипов валидности конструкта, но не другим. Например, исследователь может разработать опросник, в котором наблюдается очень высокая положительная корреляция между общим счастьем и удовлетворенностью жизнью, но если также существует значимая положительная корреляция между счастьем и депрессией, то валидность конструкта данной оценки ставится под сомнение. В этом случае оценка обладает сходящей, но не дискриминантной валидностью.
Номологическая сеть
Ли Кронбах и Пол Мель (1955) и кратковременная нагрузка. Создание номологической сети также может повысить эффективность наблюдения и измерения существующих конструктов, точно определяя источники ошибок.
Угрозы для создания достоверности
Очевидная конструктивная валидность может быть обманчива из-за ряда проблем в формулировании гипотез и разработке эксперимента. Угадывание гипотезы: если участник знает или догадывается о желаемом результате, его поведение может измениться. Примером является эффект Хоторна: в 1925 году в ходе исследования промышленной эргономики, проведенного на заводе Hawthorne Works под Чикаго, экспериментаторы обнаружили, что как снижение, так и повышение уровня освещенности повышали производительность труда. В конечном итоге они установили причину этого парадоксального результата: работники, знавшие, что за ними наблюдают, работали усерднее независимо от изменений в окружающей среде. Смещение в экспериментальной разработке (намеренное или ненамеренное). Пример этого приведен в книге Стивена Джея Гулда «Неправильные измерения человека» (1981). Среди вопросов, использовавшихся во время Первой мировой войны в тесте на определение интеллекта, был вопрос: «В каком городе играют «Доджерс»?» (тогда команда базировалась в Бруклине). Недавние иммигранты из Восточной Европы, незнакомые с бейсболом, давали неправильные ответы, что использовалось для обоснования предположения о более низком интеллекте восточноевропейцев. Вопрос не измерял интеллект: он измерял лишь продолжительность проживания в США и степень адаптации к популярному развлечению. Ожидания исследователя могут непреднамеренно передаваться участникам невербально, вызывая желаемый эффект. Для контроля этой возможности следует, по возможности, использовать двойные слепые экспериментальные дизайны. То есть, оценивающий конкретного участника должен не знать, какое вмешательство было применено к этому участнику, или должен быть независим от экспериментатора. Слишком узкое определение прогнозируемого результата. Например, использование только удовлетворенности работой для измерения счастья исключит релевантную информацию из областей, не связанных с работой. Смешивающие переменные (ковариаты): истинная причина наблюдаемого эффекта может заключаться в переменных, которые не были учтены или измерены. Подробное рассмотрение угроз конструктивной валидности представлено в работе Трохима.