Введение
Измерение, сбор, анализ и отчетность веб-данных
Веб-аналитика — это измерение, сбор, анализ и отчетность веб-данных для понимания и оптимизации использования веб-сайтов. Веб-аналитика – это не просто процесс измерения веб-трафика, но может использоваться как инструмент для бизнес- и маркетинговых исследований, а также для оценки и повышения эффективности веб-сайтов. Приложения веб-аналитики также могут помочь компаниям измерять результаты традиционных печатных или телевизионных рекламных кампаний. Их можно использовать для оценки изменения трафика на веб-сайт после запуска новой рекламной кампании. Веб-аналитика предоставляет информацию о количестве посетителей веб-сайта и количестве просмотров страниц, а также позволяет создавать профили поведения пользователей. Это помогает отслеживать тенденции трафика и популярности, что полезно для маркетинговых исследований.
Аналитика веб-сайтов Категории
Существует как минимум две категории веб-аналитики: аналитика вне сайта и аналитика на сайте. Аналитика вне сайта относится к веб-измерениям и анализу, независимо от того, владеет ли человек веб-сайтом или поддерживает его. Она включает в себя измерение потенциальной аудитории веб-сайта (охвата), доли присутствия в сети (видимости) и обсуждений (комментариев), происходящих в Интернете в целом. Аналитика на сайте, более распространенная из двух, измеряет поведение посетителей после того, как они попали на конкретный веб-сайт. Это включает в себя факторы, стимулирующие посещения, и конверсии; например, степень влияния различных целевых страниц на онлайн-покупки. Аналитика на сайте измеряет эффективность конкретного веб-сайта в коммерческом контексте. Эти данные обычно сравниваются с ключевыми показателями эффективности для оценки результатов и используются для улучшения реакции аудитории на веб-сайт или маркетинговую кампанию. Google Analytics и Adobe Analytics – наиболее широко используемые сервисы веб-аналитики на сайте; хотя появляются новые инструменты, предоставляющие дополнительные уровни информации, включая тепловые карты и запись сеансов. Ранее веб-аналитика использовалась для обозначения измерений посещаемости сайта. Однако это значение стало менее четким, главным образом потому, что поставщики разрабатывают инструменты, охватывающие обе категории. Многие различные поставщики предоставляют программное обеспечение и услуги для веб-аналитики на сайте. Существует два основных технических способа сбора данных. Первый и традиционный метод – анализ журналов сервера – считывает файлы журналов, в которых веб-сервер записывает запросы файлов от браузеров. Второй метод – простановка меток на страницах – использует JavaScript, встроенный в веб-страницу, для отправки запросов изображений на выделенный сервер аналитики стороннего поставщика каждый раз, когда веб-страница отображается в веб-браузере или, при необходимости, при щелчке мышью. Оба метода собирают данные, которые можно обработать для создания отчетов о веб-трафике.
Аналитика веб-сайтов на месте
В веб-аналитике не существует общепринятых определений, поскольку отраслевые организации уже некоторое время пытаются согласовать полезные и однозначные определения. Это означает, что метрики в инструментах и продуктах разных компаний могут измеряться и подсчитываться по-разному, в результате чего одно и то же название метрики может иметь различное значение данных. Основными организациями, внесшими вклад в эту область, являются IAB (Интерактивное рекламное бюро), JICWEBS (Совместный отраслевой комитет по веб-стандартам Великобритании и Ирландии) и DAA (Ассоциация цифровой аналитики), ранее известная как WAA (Ассоциация веб-аналитики США). Однако многие термины используются последовательно в различных основных аналитических инструментах, поэтому следующий список, основанный на этих соглашениях, может служить полезной отправной точкой:
Показатель отказов – процент посещений, состоящих из просмотра одной страницы без каких-либо дополнительных взаимодействий (кликов) на этой странице. Иными словами, одиночный клик в рамках определенной сессии считается отказом. Высокий показатель отказов может указывать на необходимость улучшения контента или пользовательского опыта. Путь перехода – хронологическая последовательность просмотров страниц в рамках посещения или сессии. Анализ этого пути предоставляет информацию о целях сессии и целях пользователей. Хит – запрос файла с веб-сервера. Доступен только при анализе логов. Количество хитов, полученных веб-сайтом, часто используется для оценки его популярности, но эта цифра крайне вводит в заблуждение и значительно завышает реальную популярность. Одна веб-страница обычно состоит из нескольких (часто десятков) отдельных файлов, каждый из которых учитывается как хит при загрузке страницы. Таким образом, количество хитов – это условная величина, скорее отражающая сложность отдельных страниц веб-сайта, чем его фактическую популярность. Общее количество посещений или просмотров страниц дает более реалистичную и точную оценку популярности. Просмотр страницы (pageview) – запрос файла или, иногда, событие, такое как клик мыши, которое определено как страница в настройках инструмента веб-аналитики. Обычно количество просмотров страниц превышает количество посещений и посетителей (уникальных посетителей). Это событие запуска скрипта в тегах страниц. При анализе логов один просмотр страницы может генерировать несколько хитов, поскольку все ресурсы, необходимые для отображения страницы (изображения, файлы js и css), также запрашиваются с веб-сервера. Обновление той же веб-страницы может быть учтено как еще один просмотр страницы. Например, в 16:07 пользователь просмотрел страницу A, а через 2 секунды нажал кнопку "Обновить" в браузере, в результате чего количество просмотров страницы A стало равно 2. Посетитель/уникальный посетитель/уникальный пользователь – уникально идентифицированный клиент, генерирующий просмотры страниц или хиты в течение определенного периода времени (например, дня, недели или месяца). Уникально идентифицированный клиент обычно представляет собой комбинацию устройства (например, рабочий компьютер) и браузера (например, Firefox на этом устройстве). Идентификация обычно осуществляется с помощью постоянного cookie-файла, размещенного на компьютере кодом страницы сайта. Более старый метод, используемый при анализе лог-файлов, – это уникальная комбинация IP-адреса компьютера и информации о User Agent (браузере), предоставляемой веб-серверу браузером. "Посетитель" – это не обязательно тот человек, который сидит за компьютером во время посещения, поскольку один и тот же человек может использовать разные компьютеры или разные браузеры на одном компьютере, и в каждом случае будет считаться отдельным посетителем. Все чаще, но пока еще не повсеместно, посетители идентифицируются уникальными Flash LSO (Local Shared Objects), которые менее подвержены ограничениям конфиденциальности. Посещение/сессия – посещение или сессия определяется как серия запросов страниц или, в случае использования тегов, запросов изображений от одного и того же уникально идентифицированного клиента. Обычно количество посещений превышает количество посетителей (уникальных посетителей). Уникальный клиент обычно идентифицируется по IP-адресу или уникальному идентификатору, помещенному в cookie-файл браузера. Посещение считается завершенным, когда в течение определенного периода времени не было зарегистрировано ни одного запроса. Многие аналитические инструменты используют лимит в 30 минут ("тайм-аут"), но в некоторых инструментах (например, Google Analytics) его можно изменить. Инструменты сбора и анализа данных не имеют надежного способа узнать, просматривал ли посетитель другие сайты между просмотрами страниц; посещение считается одним, если события (просмотры страниц, клики и т.д.) произошли в течение 30 минут друг от друга. Посещение может состоять из одного просмотра страницы или тысяч. Уникальная сессия может быть продлена, если время между загрузками страниц указывает на то, что посетитель непрерывно просматривал страницы. Активное время/время вовлечения – среднее время, которое посетители тратят на непосредственное взаимодействие с контентом на веб-странице, основываясь на движениях мыши, кликах, наведениях и прокрутках. В отличие от продолжительности сессии и продолжительности просмотра страницы, эта метрика может точно измерить продолжительность вовлечения на последнем просмотренной странице, но она недоступна во многих аналитических инструментах или методах сбора данных. Средняя глубина просмотра/просмотры страниц за среднюю сессию – глубина просмотра – это приблизительный "размер" среднего посещения, рассчитанный путем деления общего количества просмотров страниц на общее количество посещений. Средняя продолжительность просмотра страницы – среднее время, которое посетители проводят на странице сайта. Клик – "относится к единичному случаю перехода пользователя по гиперссылке со страницы сайта на другую". Событие – дискретное действие или класс действий, происходящих на веб-сайте. Просмотр страницы является типом события. События также включают в себя клики, отправку форм, нажатия клавиш и другие действия пользователя на стороне клиента. Показатель выхода/% выхода – статистика, применяемая к отдельной странице, а не к веб-сайту. Процент посещений, где эта страница является последней просмотренной страницей в рамках посещения. Сегментация данных – инструменты веб-аналитики позволяют сегментировать данные, то есть разбивать их на более мелкие подмножества на основе таких критериев, как демографические данные, местоположение или поведение. Это обеспечивает более глубокое понимание различных сегментов аудитории. Первое посещение/первая сессия – (также называется "Абсолютный уникальный посетитель" в некоторых инструментах) посещение от уникально идентифицированного клиента, который, предположительно, ранее не совершал посещений. Поскольку единственный способ узнать, был ли уникально идентифицированный клиент на сайте ранее, – это наличие постоянного cookie-файла или цифрового слепка, полученного во время предыдущего посещения, метка "Первое посещение" ненадежна, если cookie-файлы сайта были удалены с момента предыдущего посещения. Частота/сессии на уникального – частота измеряет, как часто посетители возвращаются на веб-сайт за определенный период времени. Она рассчитывается путем деления общего количества сессий (или посещений) на общее количество уникальных посетителей за указанный период времени, например, месяц или год. Иногда используется как синоним термина "лояльность". Показы – наиболее распространенное определение показа – это случай отображения рекламы на просмотренной странице. Реклама может отображаться на просмотренной странице ниже области, фактически отображаемой на экране, поэтому большинство показателей показов не обязательно означают, что реклама была видимой. Новый посетитель – посетитель, который ранее не совершал посещений. Это определение может вызывать определенную путаницу (см. распространенные заблуждения ниже) и иногда заменяется анализом первых посещений. Время просмотра страницы/время видимости страницы/продолжительность просмотра страницы – время, в течение которого отдельная страница (или блог, рекламный баннер) находится на экране, измеряемое как разница между временем запроса этой страницы и временем следующего зарегистрированного запроса. Если следующего зарегистрированного запроса нет, время просмотра этого экземпляра страницы не включается в отчеты. Повторный посетитель – посетитель, который совершил хотя бы одно предыдущее посещение. Период между последним и текущим посещением составляет...
Вне сайта веб-аналитика
Аналитика вне сайта основывается на анализе открытых данных, исследовании социальных сетей и определении доли упоминаний в интернете. Обычно она используется для понимания стратегии продвижения сайта путем выявления ключевых слов, связанных с ним, из социальных сетей или других веб-сайтов.
Источники данных веб-аналитики
Основная цель веб-аналитики — сбор и анализ данных, связанных с веб-трафиком и моделями поведения пользователей. Данные поступают главным образом из четырех источников:
Данные прямых HTTP-запросов: поступают непосредственно из сообщений HTTP-запроса (заголовки HTTP-запросов). Данные сетевого уровня и сервера, связанные с HTTP-запросами: не являются частью HTTP-запроса, но необходимы для успешной передачи запроса, например, IP-адрес отправителя запроса. Данные уровня приложений, отправляемые с HTTP-запросами: генерируются и обрабатываются программами уровня приложений (такими как JavaScript, PHP и ASP.Net), включая сессии и источники переходов. Обычно они фиксируются во внутренних логах, а не общедоступными сервисами веб-аналитики. Внешние данные: могут быть объединены с данными, собранными на сайте, для расширения информации о поведении пользователей и интерпретации использования веб-сайта. Например, IP-адреса обычно связаны с географическими регионами и интернет-провайдерами, показателями открытия и переходов по ссылкам в электронных письмах, данными кампаний прямой почтовой рассылки, продажами, историей лидов или другими необходимыми типами данных.
Direct HTTP request data: directly comes from HTTP request messages (HTTP request headers). Network level and server generated data associated with HTTP requests: not part of an HTTP request, but it is required for successful request transmissions for example, the IP address of a requester. Application level data sent with HTTP requests: generated and processed by application level programs (such as JavaScript, PHP, and ASP. Net), including sessions and referrals. These are usually captured by internal logs rather than public web analytics services. External data: can be combined with on site data to help augment the website behavior data described above and interpret web usage. For example, IP addresses are usually associated with Geographic regions and internet service providers, e mail open and click through rates, direct mail campaign data, sales, lead history, or other data types as needed.
Анализ файлов журналов веб-сервера
Веб-серверы записывают некоторые из своих транзакций в файл журнала. Вскоре стало понятно, что эти файлы журналов можно анализировать с помощью программ, чтобы получать данные о популярности веб-сайта. Так и появилось программное обеспечение для анализа веб-журналов. В начале 1990-х годов статистика веб-сайтов в основном сводилась к подсчету количества запросов клиентов (или хитов), поступающих на веб-сервер. Это был разумный подход на начальном этапе, поскольку каждый веб-сайт часто состоял из одного HTML-файла. Однако с появлением изображений в HTML и веб-сайтов, состоящих из нескольких HTML-файлов, эта статистика стала менее информативной. Первый коммерческий анализатор журналов был выпущен компанией IPRO в 1994 году. В середине 1990-х годов для более точной оценки активности пользователей на веб-серверах были введены две метрики: просмотры страниц и посещения (или сеансы). Просмотр страницы определялся как запрос к веб-серверу за страницей, а не за графическим файлом, в то время как посещение определялось как последовательность запросов от уникально идентифицированного клиента, которая завершалась после определенного периода бездействия, обычно 30 минут. В конце 1990-х годов появление поисковых роботов и пауков, а также веб-прокси и динамически назначаемые IP-адреса для крупных компаний и интернет-провайдеров затруднило идентификацию уникальных посетителей веб-сайта. Анализаторы журналов отреагировали на это, отслеживая посещения с помощью cookie и игнорируя запросы от известных пауков. Широкое использование веб-кэшей также создавало проблему при анализе файлов журналов. Если пользователь повторно посещает страницу, второй запрос часто извлекается из кэша браузера, и веб-сервер не получает запрос. Это приводит к потере информации о пути пользователя по сайту. Кэширование можно отключить, настроив веб-сервер, но это может привести к снижению производительности для пользователя и увеличению нагрузки на серверы.
Отображение страниц
Опасения по поводу точности анализа файлов журналов при наличии кэширования и стремление предоставлять веб-аналитику как услугу аутсорсинга привели к разработке второго метода сбора данных – маркировки страниц, или "веб-маяков". В середине 1990-х годов широко использовались веб-счетчики – это были изображения, встроенные в веб-страницу, которые отображали количество запросов к этому изображению, что являлось приблизительной оценкой числа посещений страницы. В конце 1990-х годов эта концепция эволюционировала в использование небольшого невидимого изображения вместо видимого, а также, с помощью JavaScript, передачу вместе с запросом изображения определенных данных о странице и посетителе. Эта информация затем может быть обработана удаленно компанией, предоставляющей услуги веб-аналитики, для генерации подробной статистики. Сервис веб-аналитики также управляет процессом назначения cookie пользователю, что позволяет уникально идентифицировать его во время текущего и последующих посещений. Уровень принятия cookie существенно различается между веб-сайтами и может влиять на качество собираемых и представляемых данных. Сбор данных веб-сайта с использованием стороннего сервера сбора данных (или даже собственного) требует дополнительного DNS-запроса от компьютера пользователя для определения IP-адреса сервера сбора данных. Иногда задержки при выполнении успешных или неудачных DNS-запросов могут приводить к потере данных. С ростом популярности Ajax-решений, альтернативой использованию невидимого изображения является реализация обратного вызова на сервер со стороны отрисованной страницы. В этом случае, при отрисовке страницы в веб-браузере, фрагмент кода JavaScript осуществляет обратный вызов на сервер и передает информацию о клиенте, которую затем может агрегировать компания веб-аналитики.
Анализ файлов журналов против маркировки страниц
Программы анализа журналов и решения для тегирования страниц легко доступны компаниям, желающим проводить веб-аналитику. В некоторых случаях одна и та же компания, предоставляющая услуги веб-аналитики, предлагает оба подхода. В этом случае возникает вопрос о том, какой метод следует выбрать. У каждого из этих методов есть свои преимущества и недостатки.
Экономические факторы
Анализ файлов журналов почти всегда выполняется внутри компании. Разметка страниц может выполняться собственными силами, но чаще предоставляется как сторонняя услуга. Экономическая разница между этими двумя моделями также может быть важным фактором для компании при принятии решения о покупке. Анализ файлов журналов обычно предполагает единовременную покупку программного обеспечения, однако некоторые поставщики вводят ограничение на максимальное количество ежегодных просмотров страниц с дополнительной платой за обработку превышающего объема данных. Помимо коммерческих предложений, существует несколько инструментов анализа файлов журналов с открытым исходным кодом, доступных бесплатно. Для анализа файлов журналов необходимо хранить и архивировать данные, объем которых часто быстро растет. Хотя стоимость оборудования для этого невелика, нагрузка на ИТ-отдел может быть значительной. Программное обеспечение для анализа файлов журналов требует обслуживания, включая установку обновлений и патчей безопасности. Поставщики комплексной разметки страниц взимают ежемесячную плату, основанную на объеме, то есть на количестве просмотров страниц в месяц. Что дешевле внедрить – зависит от уровня технической экспертизы в компании, выбранного поставщика, объема активности на веб-сайтах, глубины и типа необходимой информации, а также количества отдельных веб-сайтов, для которых требуется статистика. Независимо от выбранного решения поставщика или метода сбора данных, необходимо учитывать стоимость анализа и интерпретации данных о посетителях веб-сайтов. То есть, стоимость преобразования необработанных данных в полезную информацию. Это может быть привлечение сторонних консультантов, найм опытного веб-аналитика или обучение подходящего сотрудника внутри компании. После этого можно провести анализ затрат и выгод. Например, какой рост выручки или экономия затрат можно получить благодаря анализу данных о посетителях веб-сайтов?
Гибридные методы
Некоторые компании разрабатывают решения, которые собирают данные как из журналов, так и с помощью тегов на страницах, и способны анализировать оба типа данных. Используя гибридный подход, они стремятся получить более точную статистику, чем при использовании каждого из этих методов по отдельности.
Географическое расположение посетителей
С помощью IP-геолокации можно отслеживать местоположение посетителей. Используя базу данных или API для IP-геолокации, можно определить местоположение посетителей до уровня города, региона или страны. IP-интеллектуальная система, или интеллектуальный анализ IP-адресов, – это технология, которая отображает структуру интернета и классифицирует IP-адреса по таким параметрам, как географическое местоположение (страна, регион, область, город и почтовый индекс), тип подключения, интернет-провайдер (ISP), информация о прокси-серверах и многое другое. Первое поколение IP-интеллектуальных систем называлось технологией геотаргетинга или геолокации. Эта информация используется компаниями для сегментации онлайн-аудитории в таких областях, как онлайн-реклама, поведенческий таргетинг, локализация контента (или локализация веб-сайта), управление цифровыми правами, персонализация, выявление онлайн-мошенничества, локальный поиск, расширенная аналитика, глобальное управление трафиком и распространение контента.
Аналитика кликов
Аналитика кликов, также известная как Clickstream, – это особый вид веб-аналитики, уделяющий особое внимание отслеживанию кликов. Как правило, аналитика кликов ориентирована на анализ поведения пользователей на сайте. Редактор сайта использует аналитику кликов для оценки эффективности своего сайта, в частности, для определения мест, по которым пользователи кликают. Анализ кликов может осуществляться в реальном времени или в отложенном режиме, в зависимости от необходимой информации. Обычно редакторы главных страниц крупных новостных сайтов предпочитают отслеживать свои страницы в реальном времени для оптимизации контента. Редакторы, дизайнеры и другие заинтересованные лица могут анализировать клики за более длительный период времени, чтобы оценить эффективность работы авторов, элементов дизайна или рекламных материалов и т.д. Данные о кликах можно собирать как минимум двумя способами. В идеале, клик "регистрируется" в момент его совершения, что требует функциональности для сбора соответствующей информации о событии. Альтернативно, можно исходить из предположения, что просмотр страницы является результатом клика, и регистрировать имитированный клик, приведший к этому просмотру.
Анализ жизненного цикла клиента
Анализ жизненного цикла клиента – это подход к измерениям, ориентированный на посетителей. Просмотры страниц, клики и другие события (такие как вызовы API, доступ к сторонним сервисам и т. д.) привязываются к конкретному посетителю, а не хранятся как отдельные точки данных. Анализ жизненного цикла клиента стремится объединить все точки данных в маркетинговую воронку, что позволяет получить представление о поведении посетителей и оптимизировать веб-сайт. К распространенным метрикам, используемым в анализе жизненного цикла клиента, относятся стоимость привлечения клиента (CAC), пожизненная ценность клиента (CLV), отток клиентов и показатели удовлетворенности клиентов. Оба этих метода заявляют о предоставлении более оперативных данных, чем другие подходы.
Аналитики отравления
По мере развития интернета, распространение автоматизированного бот-трафика становится все более серьезной проблемой для достоверности веб-аналитики. Боты, перемещаясь по интернету, отображают веб-страницы подобно реальным пользователям и, как следствие, могут непреднамеренно активировать тот же код, который веб-аналитические системы используют для подсчета трафика. Совместное, случайное срабатывание событий веб-аналитики снижает интерпретируемость данных и обоснованность выводов, сделанных на их основе. IPM продемонстрировал на практике, что Google Analytics и его конкуренты легко активируются при использовании распространенных стратегий развертывания ботов.
Проблемы с файлами cookie третьих сторон
Исторически сложилось так, что поставщики решений для аналитики с помощью меток страниц использовали сторонние cookie, отправляемые с домена поставщика, а не с домена просматриваемого веб-сайта. Сторонние cookie позволяют отслеживать посетителей, переходящих между несколькими несвязанными доменами в рамках сайта компании, поскольку cookie всегда обрабатываются серверами поставщика. Однако, в принципе, сторонние cookie позволяют отслеживать конкретного пользователя на сайтах различных компаний, что позволяет поставщику аналитических услуг сопоставлять действия пользователя на сайтах, где он предоставил личную информацию, с его действиями на других сайтах, где он полагал, что остается анонимным. Хотя компании, занимающиеся веб-аналитикой, отрицают это, другие компании, например, поставщики баннерной рекламы, делали это. Опасения по поводу конфиденциальности, связанные с cookie, привели к тому, что заметная часть пользователей блокирует или удаляет сторонние cookie. В 2005 году некоторые отчеты показали, что около 28% пользователей Интернета блокировали сторонние cookie, а 22% удаляли их хотя бы раз в месяц. Большинство поставщиков решений для меток страниц теперь предлагают как минимум возможность использования cookie первой стороны (cookie, назначаемые из поддомена клиента). Другая проблема – удаление cookie. Поскольку веб-аналитика зависит от cookie для идентификации уникальных посетителей, статистика зависит от постоянного cookie, хранящего уникальный идентификатор посетителя. Когда пользователи удаляют cookie, они обычно удаляют как cookie первой, так и третьей стороны. Если это происходит между взаимодействиями с сайтом, пользователь будет отображаться как новый посетитель при следующем взаимодействии. Без постоянного и уникального идентификатора посетителя, конверсии, анализ цепочки кликов и другие показатели, зависящие от действий уникального посетителя с течением времени, не могут быть точными. Cookie используются, поскольку IP-адреса не всегда уникальны для пользователей и могут быть общими для больших групп или прокси-серверов. В некоторых случаях IP-адрес объединяется с user-agent для более точной идентификации посетителя, если cookie недоступны. Однако это лишь частично решает проблему, поскольку пользователи, находящиеся за прокси-сервером, часто имеют один и тот же user-agent. Другие методы уникальной идентификации пользователя технически сложны и могут ограничить отслеживаемую аудиторию или считаться подозрительными. Cookie обеспечивают минимальный общий знаменатель без использования технологий, рассматриваемых как шпионское ПО, а использование включенных/активных cookie вызывает опасения по поводу безопасности.
Безопасные методы анализа (измерения)
Сбор информации третьими сторонами подвержен любым сетевым ограничениям и применяемым мерам безопасности. Страны, поставщики услуг и частные сети могут блокировать передачу данных о посещениях сайтов третьим лицам. Все описанные выше методы (и некоторые другие, не упомянутые здесь, например, выборка) имеют общую проблему – уязвимость к манипуляциям (как к завышению, так и к занижению показателей). Это означает, что эти методы неточны и ненадежны (в любой адекватной модели безопасности). Эта проблема рассматривалась в ряде исследований, однако предложенные в них решения на сегодняшний день остаются теоретическими.