Введение

Последовательное извлечение паттернов - это тема извлечения данных, связанная с поиском статистически значимых паттернов между примерами данных, где значения предоставляются в последовательности. Обычно предполагается, что значения дискретны, и, таким образом, добыча временных рядов тесно связана, но обычно считается другой деятельностью. Секвенциальный образец добычи является особым случаем структурированного добычи данных. В этой области рассматривается несколько ключевых традиционных вычислительных проблем. Они включают в себя создание эффективных баз данных и индексов для информации о последовательности, извлечение часто встречающихся шаблонов, сравнение последовательностей для сходства и восстановление отсутствующих членов последовательности. В целом, проблемы секвенциального майнинга можно классифицировать как струнный майнинг, который обычно основан на алгоритмах обработки струн, и майнинг элементов, который обычно основан на обучении правилам ассоциации. Локальные модели процессов расширяют последовательное извлечение шаблонов до более сложных шаблонов, которые могут включать (исключительные) выбор, петли и конструкты параллельности в дополнение к последовательному конструкту упорядочения.

Добыча набора элементов

Некоторые проблемы в последовательном майнинге подходят для обнаружения частых наборов элементов и порядка их появления, например, мы ищем правила формы "если {клиент покупает автомобиль}, он или она, вероятно, {купит страховку} в течение 1 недели", или в контексте цен на акции, "если {Nokia вверх и Ericsson вверх}, вероятно, что {Motorola вверх и Samsung вверх} в течение 2 дней". Традиционно, извлечение элементов используется в маркетинговых приложениях для обнаружения закономерностей между часто совпадающими элементами в крупных сделках. Например, анализируя транзакции покупательских корзинок в супермаркете, можно изготовить правило, которое гласит: "если клиент покупает лук и картофель вместе, он или она, вероятно, также купит мясо гамбургера в той же транзакции". Обзор и таксономия ключевых алгоритмов для добычи множеств элементов представлены Han et al. (2007 г.) Два распространенных метода, которые применяются к последовательности баз данных для частого извлечения элементов, - это влиятельный априорный алгоритм и более поздняя техника роста FP.

Приложения

С большим разнообразием продуктов и покупательского поведения пользователей, полка, на котором выставляются продукты, является одним из самых важных ресурсов в розничной среде. Розничные торговцы могут не только увеличить свою прибыль, но и снизить затраты путем правильного управления распределением места на полках и отображением продукции. Для решения этой проблемы, Джордж и Бину (2013) предложили подход к модели покупки пользователей с использованием алгоритма PrefixSpan и размещение продуктов на полках на основе порядка модели покупки.