Введение

Алгоритм обнаружения признаков в компьютерном зрении

Трансформация масштабно-инвариантных признаков (SIFT) — это алгоритм компьютерного зрения для обнаружения, описания и сопоставления локальных признаков на изображениях, разработанный Дэвидом Лоу в 1999 году.

Локализация ключевых точек

Экстремальная детекция масштаба выдает слишком много кандидатов в ключевые точки, некоторые из которых неустойчивы. Следующим шагом алгоритма является точное сопоставление с близлежащими данными для определения точного местоположения, масштаба и отношения главных кривизн. Эта информация позволяет отбросить точки с низким контрастом (и, следовательно, чувствительные к шуму) или плохо локализованные вдоль границы.

Интерполяция близлежащих данных для точного местоположения

Во-первых, для каждой потенциальной ключевой точки используется интерполяция соседних данных для точного определения её положения. Изначально ключевая точка просто локализовалась в месте и масштабе потенциальной ключевой точки. Порог в 0,2 был выбран эмпирически, и замена фиксированного порога на систематически вычисляемый позволяет улучшить результаты сопоставления. Также используется возможность определения абсолютной позы по двум ключевым точкам – часто недооцениваемая, но полезная характеристика, доступная в SIFT. Эти измерения ориентации уменьшают необходимое количество соответствий, что экспоненциально повышает устойчивость.

Панорамный швей

Соответствие признаков SIFT может использоваться в склейке изображений для полностью автоматизированной реконструкции панорам из изображений, не являющихся панорамами. Признаки SIFT, извлеченные из входных изображений, сопоставляются друг с другом для поиска k ближайших соседей для каждого признака. Эти соответствия затем используются для поиска m кандидатов на совпадающие изображения для каждого изображения. Гомографии между парами изображений вычисляются с использованием RANSAC, а вероятностная модель используется для верификации. Поскольку на входные изображения нет ограничений, применяется поиск по графу для определения связных компонент соответствий изображений, так что каждая связная компонента будет соответствовать панораме. Наконец, для каждой связной компоненты выполняется уточнение параметров (bundle adjustment) для решения задачи совместной оценки параметров камер, и панорама отрисовывается с использованием многополосного смешивания. Благодаря подходу к склейке панорам, вдохновленному методом SIFT для распознавания объектов, полученная система нечувствительна к порядку, ориентации, масштабу и освещению изображений. Входные изображения могут содержать несколько панорам и шумовые изображения (некоторые из которых могут даже не входить в состав итогового изображения), а панорамные последовательности распознаются и отрисовываются в качестве результата.

3D-дескрипиторы типа SIFT для распознавания человеческих действий

Изучены расширения дескриптора SIFT на пространственно-временные данные 2+1 измерения в контексте распознавания человеческих действий в видеопоследовательностях. Данный дескриптор является чисто изобразительным, определяемым выполнением всех измерений изображения, лежащих в основе дескриптора SIFT, с использованием откликов гауссовых производных, в отличие от приближений производных в пирамиде изображений, как это делается в стандартном SIFT. Таким образом, эффекты дискретизации по пространству и масштабу могут быть сведены к минимуму, что потенциально позволяет получить более точные дескрипторы изображений. В Линдеберге (2015).