Введение
Класс методов статистического моделирования
Условные случайные поля (УРП) — это класс методов статистического моделирования, часто применяемых в распознавании образов и машинном обучении, используемых для структурированного предсказания. В отличие от классификатора, который предсказывает метку для отдельного образца, не учитывая «соседние» образцы, УРП может принимать во внимание контекст. Для этого предсказания моделируются в виде графической модели, отражающей наличие зависимостей между ними. Тип используемого графа зависит от конкретной задачи. Например, в обработке естественного языка популярны УРП с «линейной цепью», где каждое предсказание зависит только от своих непосредственных соседей. В обработке изображений граф обычно связывает области с близлежащими и/или схожими областями, обеспечивая им схожие предсказания. Другие области применения УРП включают: разметку или синтаксический анализ последовательных данных для обработки естественного языка или биологических последовательностей, определение частей речи, поверхностный синтаксический анализ, распознавание именованных сущностей, поиск генов, определение критически важных функциональных областей пептидов, а также распознавание объектов и сегментацию изображений в компьютерном зрении.
Обучение параметрам
Обучение параметров обычно выполняется методом максимального правдоподобия. Если все узлы имеют распределения из экспоненциального семейства и все узлы наблюдаются в процессе обучения, эта оптимизация является выпуклой. Однако, недавний прогресс позволил смягчить эти проблемы, используя концепции и инструменты из области байесовской непараметрики. В частности, подход CRF infinity представляет собой модель типа CRF, способную к обучению бесконечно длинной временной динамике масштабируемым образом. Это достигается путем введения новой потенциальной функции для CRF, основанной на Sequence Memoizer (SM) – непараметрической байесовской модели для изучения бесконечно длинной динамики в последовательных наблюдениях. Для обеспечения вычислительной реализуемости такой модели, CRF infinity использует приближение среднего поля для постулированных новых потенциальных функций (управляемых SM). Это позволяет разработать эффективные приближенные алгоритмы обучения и вывода для модели, не снижая ее способности захватывать и моделировать временные зависимости произвольной длины. Существует также другое обобщение CRF – полумарковское условное случайное поле (semi CRF), которое моделирует сегментации переменной длины последовательности меток. Это обеспечивает значительную часть мощности CRF более высокого порядка для моделирования зависимостей на больших расстояниях при разумных вычислительных затратах. Наконец, модели с большим запасом прочности для структурированного предсказания, такие как структурированная машина опорных векторов, можно рассматривать как альтернативный метод обучения CRF.
However, another recent advance has managed to ameliorate these issues by leveraging concepts and tools from the field of Bayesian nonparametrics. Specifically, the CRF infinity approach constitutes a CRF type model that is capable of learning infinitely long temporal dynamics in a scalable fashion. This is effected by introducing a novel potential function for CRFs that is based on the Sequence Memoizer (SM), a nonparametric Bayesian model for learning infinitely long dynamics in sequential observations. To render such a model computationally tractable, CRF infinity employs a mean field approximation of the postulated novel potential functions (which are driven by an SM). This allows for devising efficient approximate training and inference algorithms for the model, without undermining its capability to capture and model temporal dependencies of arbitrary length. There exists another generalization of CRFs, the semi Markov conditional random field (semi CRF), which models variable length segmentations of the label sequence This provides much of the power of higher order CRFs to model long range dependencies of the , at a reasonable computational cost. Finally, large margin models for structured prediction, such as the structured Support Vector Machine can be seen as an alternative training procedure to CRFs.
Латентно-динамическое условное случайное поле
Латентные динамические условные случайные поля (LDCRF) или дискриминативные вероятностные модели латентных переменных (DPLVM) — это тип CRF для задач последовательной разметки. Это модели скрытых переменных, которые обучаются дискриминативно. В LDCRF, как и в любой задаче последовательной разметки, при заданной последовательности наблюдений x = , основная задача модели заключается в том, чтобы назначить последовательность меток y = из конечного множества меток Y. Вместо прямого моделирования P(y|x), как это делает обычная линейно-цепная CRF, между x и y "вставляется" набор скрытых переменных h, используя правило цепочки вероятностей:
Это позволяет учитывать скрытую структуру между наблюдениями и метками. Хотя LDCRF можно обучать с помощью квазиньютоновских методов, для них также была разработана специализированная версия алгоритма перцептрона, называемая перцептроном для латентных переменных, основанная на структурированном алгоритме перцептрона Коллинза. Эти модели находят применение в компьютерном зрении, в частности, в распознавании жестов по видеопотокам и неглубоком синтаксическом анализе.