Введение

Метод исследования для изучения документов и коммуникационных артефактов

Анализ контента – это изучение документов и коммуникационных артефактов, которые могут представлять собой тексты различных форматов, изображения, аудио- или видеоматериалы. Социальные науки используют анализ контента для изучения закономерностей в коммуникации воспроизводимым и систематическим образом. Одним из ключевых преимуществ использования анализа контента для анализа социальных явлений является его неинвазивность, в отличие от моделирования социальных ситуаций или сбора данных опросами. Методы и подходы к анализу контента варьируются в зависимости от академической дисциплины. Все они предполагают систематическое чтение или наблюдение текстов или артефактов, которым присваиваются метки (иногда называемые кодами) для обозначения наличия интересных и значимых элементов контента. Систематически маркируя содержание набора текстов, исследователи могут количественно анализировать закономерности контента с помощью статистических методов или использовать качественные методы для анализа значений, заключенных в текстах. Компьютеры все чаще используются в анализе контента для автоматизации маркировки (или кодирования) документов. Простые вычислительные методы могут предоставлять описательные данные, такие как частота слов и длина документов. Классификаторы машинного обучения могут значительно увеличить объем текстов, которые можно промаркировать, однако научная ценность этого остается предметом дискуссий. Кроме того, существует множество компьютерных программ для автоматизированного анализа текста (CATA), которые анализируют текст на предмет заранее определенных лингвистических, семантических и психологических характеристик.

Качественный и количественный анализ содержания

Количественный анализ содержания акцентирует внимание на подсчете частоты и статистическом анализе этих закодированных частот. Кроме того, количественный анализ контента начинается с четко сформулированной гипотезы, а схема кодирования определяется до начала анализа. Эти категории кодирования напрямую связаны с гипотезой исследователя. Количественный анализ также использует дедуктивный подход. Примеры переменных и конструкций контент-анализа можно найти, например, в базе данных DOCA с открытым доступом. Эта база данных собирает, систематизирует и оценивает релевантные переменные контент-анализа в области коммуникационных и политологических исследований. Зигфрид Кракауэр критикует количественный анализ, утверждая, что он чрезмерно упрощает сложные коммуникации в стремлении к большей надежности. С другой стороны, качественный анализ имеет дело со сложностями скрытых интерпретаций, в то время как количественный фокусируется на манифестном содержании. Он также признает наличие "перекрытия" между качественным и количественным анализом контента. Данные из архива могут быть использованы в будущих исследованиях для обеспечения высокого качества и сопоставимости инструментов. DOCA охватывает, в частности, показатели для контент-анализа художественных медиа и развлечений (например, показатели сексуализации в видеоиграх), пользовательского медиа-контента (например, показатели онлайн-ненависти) и новостных СМИ и журналистики (например, показатели использования стоковых фотографий в освещении случаев сексуального насилия над детьми и показатели персонализации в освещении избирательных кампаний).

Вычислительные инструменты

С появлением общедоступных вычислительных средств, таких как персональные компьютеры, методы анализа на основе компьютеров набирают популярность. Ответы на открытые вопросы, газетные статьи, программы политических партий, медицинские записи или систематические наблюдения в ходе экспериментов – все это может подвергаться систематическому анализу текстовых данных. Преобразование содержания коммуникации в машиночитаемый текст позволяет анализировать входные данные по частоте встречаемости и кодировать их в категории для формирования выводов. Компьютерный анализ может быть полезен при работе с большими электронными наборами данных, экономя время и избавляя от необходимости в привлечении нескольких кодировщиков для обеспечения согласованности между ними. Тем не менее, человеческие кодировщики по-прежнему могут использоваться для контент-анализа, поскольку они часто лучше способны улавливать тонкие нюансы и скрытые смыслы в тексте. Одно исследование показало, что человеческие кодировщики способны оценивать более широкий спектр данных и делать выводы, основанные на скрытых смыслах.

Надежность и обоснованность

Роберт Вебер отмечает: "Чтобы делать обоснованные выводы на основе текста, важно, чтобы процедура классификации была надежной в смысле согласованности: разные кодировщики должны кодировать один и тот же текст одинаково". Валидность, надежность между кодировщиками и надежность внутри кодировщика на протяжении многих лет являются предметом интенсивных методологических исследований. Лейси и Риффе считают измерение надежности между кодировщиками сильной стороной количественного анализа содержания, утверждая, что если аналитики контента не измеряют надежность между кодировщиками, их данные не более надежны, чем субъективные впечатления одного читателя. Согласно современным стандартам публикации, количественные анализы содержания должны сопровождаться полными кодировочными книгами, и для всех переменных или показателей в кодировочной книге должны быть представлены соответствующие коэффициенты надежности между кодировщиками или оценщиками, полученные на основе эмпирических предварительных тестов. Кроме того, необходимо обеспечить валидность всех переменных или показателей в кодировочной книге. Этого можно достичь, используя устоявшиеся методы, которые уже доказали свою валидность в предыдущих исследованиях. Также содержательная валидность показателей может быть проверена экспертами в данной области, которые тщательно изучают и затем одобряют или корректируют инструкции по кодированию, определения и примеры в кодировочной книге.

История

Анализ контента – это исследование, использующее категоризацию и классификацию речи, письменного текста, интервью, изображений или других форм коммуникации. В самом начале, с использованием первых газет в конце XIX века, анализ проводился вручную путем измерения количества колонок, посвященных определенной теме. Этот подход также можно проследить до студента университета, изучавшего закономерности в литературе Шекспира в 1893 году. На протяжении многих лет анализ контента применялся в самых разных областях. Герменевтика и филология давно используют анализ контента для интерпретации священных и светских текстов и, во многих случаях, для установления авторства и подлинности текстов. В последнее время, особенно с развитием массовой коммуникации, анализ контента получил все более широкое распространение для глубокого анализа и понимания медиаконтента и медиалогики. Политолог Гарольд Лассвелл сформулировал ключевые вопросы анализа контента в его ранней, широко распространенной версии середины XX века: «Кто говорит что, кому, зачем, в какой степени и с каким эффектом?». Сильный акцент на количественном подходе, начатый Лассвеллом, был окончательно реализован другим «отцом» анализа контента, Бернардом Берелсоном, который предложил определение анализа контента, являющееся, с этой точки зрения, показательным: «метод исследования для объективного, систематического и количественного описания манифестного содержания коммуникации». Количественный анализ контента в последние годы переживает возрождение популярности благодаря технологическому прогрессу и успешному применению в исследованиях массовой и межличностной коммуникации. Анализ контента больших текстовых данных, генерируемых новыми медиа, особенно социальными сетями и мобильными устройствами, стал широко распространен. Эти подходы придерживаются упрощенного взгляда на язык, игнорируя сложность семиозиса – процесса, посредством которого смысл формируется из языка. Количественных аналитиков контента критикуют за ограничение сферы анализа контента простым подсчетом и за применение методологий измерения, используемых в естественных науках, без критической оценки их применимости к социальным наукам. В то же время, качественных аналитиков контента критикуют за недостаточную систематичность и излишний субъективизм.

Латентный и явный контент

Явное содержание легко понять, принимая его за чистую монету. Его значение прямое. Скрытое содержание не столь очевидно и требует интерпретации для выявления смысла или подразумеваемого значения.

Разработка первоначальной схемы кодирования

Процесс разработки первоначальной схемы кодирования или подхода к кодированию зависит от выбранного метода анализа содержания. При направленном анализе содержания исследователи разрабатывают предварительную схему кодирования, основываясь на существующей теории или предположениях. В то время как при обычном (конвенциональном) анализе содержания первоначальная схема кодирования формируется непосредственно из данных.

Обычный процесс кодирования

При любом из вышеперечисленных подходов исследователям рекомендуется глубокое погружение в данные для формирования общего представления. Кроме того, крайне важно определить последовательную и четкую единицу кодирования, при этом выбор исследователя может варьироваться от отдельного слова до нескольких абзацев, от текстовых фрагментов до знаковых символов. И, наконец, необходимо установить связи между кодами, систематизируя их в конкретные категории или темы.