Введение

Класс методов статистического моделирования

Условные случайные поля (УРП) — это класс методов статистического моделирования, часто применяемых в распознавании образов и машинном обучении, используемых для структурированного предсказания. В отличие от классификатора, который предсказывает метку для отдельного образца, не учитывая «соседние» образцы, УРП может принимать во внимание контекст. Для этого предсказания моделируются в виде графической модели, отражающей наличие зависимостей между ними. Тип используемого графа зависит от конкретной задачи. Например, в обработке естественного языка популярны УРП с «линейной цепью», где каждое предсказание зависит только от своих непосредственных соседей. В обработке изображений граф обычно связывает области с близлежащими и/или схожими областями, обеспечивая им схожие предсказания. Другие области применения УРП включают: разметку или синтаксический анализ последовательных данных для обработки естественного языка или биологических последовательностей, определение частей речи, поверхностный синтаксический анализ, распознавание именованных сущностей, поиск генов, определение критически важных функциональных областей пептидов, а также распознавание объектов и сегментацию изображений в компьютерном зрении.

Обучение параметрам

Обучение параметров обычно выполняется методом максимального правдоподобия. Если все узлы имеют распределения из экспоненциального семейства и все узлы наблюдаются в процессе обучения, эта оптимизация является выпуклой. Однако, недавний прогресс позволил смягчить эти проблемы, используя концепции и инструменты из области байесовской непараметрики. В частности, подход CRF infinity представляет собой модель типа CRF, способную к обучению бесконечно длинной временной динамике масштабируемым образом. Это достигается путем введения новой потенциальной функции для CRF, основанной на Sequence Memoizer (SM) – непараметрической байесовской модели для изучения бесконечно длинной динамики в последовательных наблюдениях. Для обеспечения вычислительной реализуемости такой модели, CRF infinity использует приближение среднего поля для постулированных новых потенциальных функций (управляемых SM). Это позволяет разработать эффективные приближенные алгоритмы обучения и вывода для модели, не снижая ее способности захватывать и моделировать временные зависимости произвольной длины. Существует также другое обобщение CRF – полумарковское условное случайное поле (semi CRF), которое моделирует сегментации переменной длины последовательности меток. Это обеспечивает значительную часть мощности CRF более высокого порядка для моделирования зависимостей на больших расстояниях при разумных вычислительных затратах. Наконец, модели с большим запасом прочности для структурированного предсказания, такие как структурированная машина опорных векторов, можно рассматривать как альтернативный метод обучения CRF.

Латентно-динамическое условное случайное поле

Латентные динамические условные случайные поля (LDCRF) или дискриминативные вероятностные модели латентных переменных (DPLVM) — это тип CRF для задач последовательной разметки. Это модели скрытых переменных, которые обучаются дискриминативно. В LDCRF, как и в любой задаче последовательной разметки, при заданной последовательности наблюдений x = , основная задача модели заключается в том, чтобы назначить последовательность меток y = из конечного множества меток Y. Вместо прямого моделирования P(y|x), как это делает обычная линейно-цепная CRF, между x и y "вставляется" набор скрытых переменных h, используя правило цепочки вероятностей:

Это позволяет учитывать скрытую структуру между наблюдениями и метками. Хотя LDCRF можно обучать с помощью квазиньютоновских методов, для них также была разработана специализированная версия алгоритма перцептрона, называемая перцептроном для латентных переменных, основанная на структурированном алгоритме перцептрона Коллинза. Эти модели находят применение в компьютерном зрении, в частности, в распознавании жестов по видеопотокам и неглубоком синтаксическом анализе.