Введение

Степень соответствия измерения реальности. Валидность – это основная степень, в которой концепция, заключение или измерение обоснованы и, вероятно, точно соответствуют реальному миру. Слово "валидный" происходит от латинского *validus*, что означает "сильный". Валидность инструмента измерения (например, теста в образовании) – это степень, в которой инструмент измеряет то, что он претендует измерять. Валидность основывается на силе совокупности различных типов доказательств (например, видимая валидность, конструктная валидность и т.д.), которые описаны более подробно ниже. В психометрии валидность имеет особое применение, известное как валидность теста: "степень, в которой доказательства и теория подтверждают интерпретацию результатов теста" ("в соответствии с предполагаемым использованием тестов"). Обычно признается, что концепция научной валидности касается природы реальности в терминах статистических измерений и, следовательно, является эпистемологическим и философским вопросом, а также вопросом измерения. Использование этого термина в логике более узкое и относится к связи между посылками и заключением аргумента. В логике валидность обозначает свойство аргумента, при котором, если посылки истинны, то истинность заключения следует необходимо. Заключение аргумента истинно, если аргумент является корректным, то есть если он валиден и его посылки истинны. В отличие от этого, "научная или статистическая валидность" не является дедуктивным утверждением, которое обязательно сохраняет истину, а является индуктивным утверждением, которое остается истинным или ложным в неопределенном виде. Именно поэтому "научная или статистическая валидность" – это утверждение, которое квалифицируется как сильное или слабое по своей природе, оно никогда не является необходимым или абсолютно истинным. Это приводит к тому, что утверждения о "научной или статистической валидности" подлежат интерпретации относительно того, что на самом деле означают факты. Валидность важна, поскольку она может помочь определить, какие типы тестов использовать, и гарантировать, что исследователи используют методы, которые не только этичны и экономически эффективны, но и действительно измеряют рассматриваемые идеи или конструкции.

Действительность (точность)

Валидность оценки – это степень, в которой она измеряет то, что предназначена измерять. Это не то же самое, что надёжность, которая показывает, насколько стабильны и согласованы результаты измерения. В валидности измерение не всегда должно быть одинаковым, в отличие от надёжности. Однако, надёжное измерение не обязательно является валидным. Например, весы, которые показывают вес с ошибкой в 5 фунтов, могут быть надёжными, но не валидными. Тест не может быть валидным, если он не надёжен. Валидность также зависит от того, измеряет ли инструмент именно то, для чего он был разработан, а не что-то иное. Валидность (как и надёжность) – это относительное понятие; валидность не бывает абсолютной. Существуют различные типы валидности.

Конструируемая валидность

Валидность конструкции относится к степени, в которой операционализации конструкта (например, практические тесты, разработанные на основе теории) измеряют конструкт, как он определен в теории. Она охватывает все остальные виды валидности. Например, вопрос о том, насколько тест измеряет интеллект, является вопросом валидности конструкции. Измерение интеллекта предполагает, в частности, что показатель связан с тем, с чем он должен быть связан (конвергентная валидность), и не связан с тем, с чем не должен быть связан (дискриминантная валидность). Доказательства валидности конструкции включают эмпирическую и теоретическую поддержку интерпретации конструкта. К таким доказательствам относятся статистический анализ внутренней структуры теста, включая взаимосвязи между ответами на различные вопросы теста, а также взаимосвязи между тестом и измерениями других конструктов. В настоящее время считается, что валидность конструкции неотделима от поддержки содержательной теории конструкта, который предназначен для измерения тест. Следовательно, эксперименты, направленные на выявление аспектов причинной роли конструкта, также способствуют формированию доказательств валидности. Перед окончательным применением опросников исследователь должен проверить валидность вопросов по отношению к каждому конструкту или переменной и, соответственно, изменить измерительные инструменты на основе мнения экспертов. Тест обладает встроенной валидностью содержания благодаря тщательному отбору включаемых вопросов (Anastasi & Urbina, 1997). Вопросы выбираются таким образом, чтобы они соответствовали спецификации теста, которая разрабатывается путем тщательного изучения предметной области. Foxcroft, Paterson, le Roux & Herbst (2004, p. 49) отмечают, что использование экспертной группы для оценки спецификаций теста и отбора вопросов может повысить валидность содержания теста. Эксперты смогут оценить вопросы и высказать свое мнение о том, охватывают ли они репрезентативную выборку из области поведения.

Валидность лица

Лицевая валидность – это оценка того, насколько тест кажется измеряющим определенный критерий; она не гарантирует, что тест действительно измеряет явления в данной области. Измерения могут обладать высокой валидностью, но если тест не выглядит так, будто измеряет то, что должен, его лицевая валидность низка. Более того, когда тест подвержен симуляции (малингеру), низкая лицевая валидность может повысить его валидность. Учитывая, что при низкой лицевой валидности можно получить более искренние ответы, иногда важно создать впечатление низкой лицевой валидности при проведении измерений. Лицевая валидность тесно связана с валидностью содержания. В то время как валидность содержания зависит от теоретического обоснования, позволяющего предположить, что тест оценивает все аспекты определенного критерия (например, дает ли оценка навыков сложения хорошую меру математических способностей? Чтобы ответить на этот вопрос, необходимо знать, какие виды арифметических навыков входят в состав математических способностей), лицевая валидность относится к тому, насколько тест кажется хорошей мерой. Оценка производится, исходя из внешнего вида теста, поэтому ее может давать даже непрофессионал. Лицевая валидность – это отправная точка, но никогда не следует считать ее достоверной для какой-либо конкретной цели, поскольку «эксперты» и раньше ошибались – «Молот ведьм» (Malleus Malificarum) не имел никаких оснований для своих выводов, кроме самонадеянной компетенции двух «экспертов» в «обнаружении колдовства», тем не менее он использовался как «тест» для осуждения и сожжения на костре десятков тысяч мужчин и женщин как «ведьм».

Действительность критерия

Доказательства критериальной валидности включают корреляцию между тестом и критериальной переменной (или переменными), рассматриваемой как репрезентативная для измеряемого конструкта. Иными словами, это сравнение теста с другими измерениями или результатами (критериями), которые уже признаны валидными. Например, тесты для отбора персонала часто валидируются на основе показателей эффективности работы (критерий), а тесты IQ – на основе показателей академической успеваемости (критерий). Если данные теста и критериальные данные собираются одновременно, это называется доказательством текущей валидности. Если данные теста собираются первыми для прогнозирования критериальных данных, собранных в более поздний момент времени, то это называется доказательством прогностической валидности.

Одновременная действительность

Одновременная валидность указывает на степень соответствия между операционализацией и другими измерениями того же конструкта, проводимыми одновременно. Если измерение сравнивается с другим измерением того же типа, то между ними должна наблюдаться связь (или корреляция). Например, если говорить о тесте для отбора персонала, это означает, что тесты проводятся среди действующих сотрудников, а затем результаты сопоставляются с их оценками по результатам работы.

Прогнозная обоснованность

Прогнозная валидность относится к степени, в которой операционализация способна предсказывать (или коррелировать с) другими измерениями того же конструкта, которые проводятся в будущем. Например, в случае с отборочным тестом, это означает, что тесты проводятся среди кандидатов, все кандидаты принимаются на работу, их производительность оценивается позднее, а затем сопоставляются баллы по двум измерениям. Это также ситуация, когда измерение предсказывает связь между тем, что измеряется, и чем-то другим, то есть предсказывает, произойдет ли это другое в будущем. Высокая корреляция между прогнозируемыми заранее (ex ante) и фактическими (ex post) результатами является наиболее сильным подтверждением валидности.

Экологическая обоснованность

Экологическая валидность – это степень, в которой результаты исследования могут быть применены к реальным жизненным ситуациям вне лабораторных условий. Этот вопрос тесно связан с внешней валидностью, но касается того, насколько экспериментальные результаты соответствуют тому, что можно наблюдать в реальном мире (экология = наука о взаимодействии организма и его среды обитания). Чтобы исследование обладало экологической валидностью, его методы, материалы и обстановка должны быть максимально приближены к изучаемой реальной ситуации. Экологическая валидность частично связана с противопоставлением эксперимента и наблюдения. В науке обычно выделяют две области исследований: наблюдательную (пассивную) и экспериментальную (активную). Цель экспериментальных исследований – установление причинно-следственных связей, позволяющее сделать вывод о том, что А вызывает В или В вызывает А. Однако иногда этические и/или методологические ограничения не позволяют провести эксперимент (например, как изоляция влияет на когнитивное развитие ребенка?). В этом случае можно проводить исследования, но они не будут устанавливать причинно-следственные связи, а лишь выявлять корреляции. Можно лишь заключить, что А и Б происходят одновременно. Оба подхода имеют свои преимущества и недостатки.

Отношение к внутренней действительности

На первый взгляд, внутренняя и внешняя валидность кажутся противоречащими друг другу – для получения экспериментального дизайна необходимо контролировать все вмешивающиеся переменные. Именно поэтому эксперименты часто проводятся в лабораторных условиях. Достигая внутренней валидности (путем исключения вмешивающихся переменных, поддерживая их постоянство), вы теряете экологическую или внешнюю валидность, поскольку создаете искусственную лабораторную среду. С другой стороны, в наблюдательных исследованиях невозможно контролировать вмешивающиеся переменные (низкая внутренняя валидность), но можно проводить измерения в естественной (экологической) среде, там, где поведение обычно проявляется. Однако, поступая так, вы жертвуете внутренней валидностью. Очевидное противоречие между внутренней и внешней валидностью, однако, лишь поверхностно. Вопрос о том, можно ли обобщить результаты конкретного исследования на других людей, в других местах или в другое время, возникает только при использовании индуктивной исследовательской стратегии. Если цель исследования – дедуктивное тестирование теории, то рассматриваются только факторы, которые могут подорвать строгость исследования, то есть угрозы внутренней валидности. Иными словами, актуальность внешней и внутренней валидности для исследования зависит от целей исследования. Более того, смешение целей исследования с вопросами валидности может привести к проблеме взаимной внутренней валидности, когда теории способны объяснять только явления в искусственных лабораторных условиях, но не в реальном мире.

Диагностическая обоснованность

В психиатрии существует особая проблема с оценкой валидности самих диагностических категорий. В этом контексте:

Кендлер (2006) подчеркнул, что для того, чтобы быть полезным, критерий валидации должен быть достаточно чувствительным, чтобы подтвердить большинство синдромов, являющихся истинными расстройствами, и в то же время достаточно специфичным, чтобы отвергнуть большинство синдромов, не являющихся истинными расстройствами. Исходя из этого, он утверждает, что критерий Робинса и Гуз о "наследственности" недостаточно специфичен, поскольку большинство человеческих психологических и физических признаков будут ему соответствовать – например, произвольный синдром, включающий сочетание "роста выше 6 футов, рыжих волос и большого носа", будет обнаруживаться как "наследственный" и "семейный", однако это не следует рассматривать как доказательство того, что это расстройство. Кендлер также предположил, что "эссенциалистские" генетические модели психических расстройств и надежда на то, что мы сможем валидизировать категориальные психиатрические диагнозы, "рассекая природу по суставам" исключительно благодаря открытию генов, маловероятны. В Федеральной судебной системе США валидность и надежность доказательств оцениваются в соответствии со стандартом Daubert: см. дело Daubert v. Merrell Dow Pharmaceuticals. Перри и Лихтенвальд (2010) предлагают отправную точку для обсуждения широкого спектра вопросов надежности и валидности в своем анализе ошибочного обвинения в убийстве.