Введение

Метод обработки изображений

Обнаружение краев включает в себя разнообразные математические методы, направленные на идентификацию краев, определяемых как кривые в цифровом изображении, в которых яркость изображения резко изменяется или, более формально, имеет разрывы. Та же задача поиска разрывов в одномерных сигналах известна как обнаружение скачков, а задача поиска разрывов сигнала во времени – как обнаружение изменений. Обнаружение краев является фундаментальным инструментом в обработке изображений, машинном зрении и компьютерном зрении, особенно в областях обнаружения и извлечения признаков.

Свойства краев

Края, извлеченные из двухмерного изображения трехмерной сцены, можно классифицировать как зависимые от точки зрения или независимые от точки зрения. Независимый от точки зрения край обычно отражает внутренние свойства трехмерных объектов, такие как текстура поверхности и ее форма. Зависимый от точки зрения край может изменяться при изменении точки зрения и обычно отражает геометрию сцены, например, когда объекты перекрывают друг друга. Типичным краем может служить, например, граница между областью красного цвета и областью желтого цвета. В отличие от этого, линия (которую можно извлечь с помощью детектора гребня) может представлять собой небольшое количество пикселей другого цвета на в остальном однородном фоне. Поэтому для линии обычно можно выделить по одному краю с каждой стороны.

Трудности

За пределами изображений с простыми объектами или при хорошо контролируемом освещении, выделение границ — нетривиальная задача, поскольку бывает сложно определить, какой порог следует использовать для определения границы между двумя пикселями. См. также энциклопедические статьи о выделении границ в Энциклопедии математики.

Умный

Джон Канни рассматривал математическую задачу вывода оптимального фильтра сглаживания, исходя из критериев обнаружения, локализации и минимизации множественных откликов на один край. Он показал, что оптимальный фильтр, при данных предположениях, представляет собой сумму четырех экспоненциальных членов. Он также показал, что этот фильтр может быть хорошо аппроксимирован производными первого порядка от гауссиан. Канни также ввел понятие не-максимального подавления, которое означает, что, учитывая фильтры предварительного сглаживания, точки границы определяются как точки, в которых величина градиента достигает локального максимума в направлении градиента. Поиск нулевых пересечений второй производной вдоль направления градиента был впервые предложен Хараликом. Менее чем через два десятилетия была найдена современная геометрическая вариационная интерпретация этого оператора, связывающая его с детектором краев Марра — Хильдета (нулевые пересечения лапласиана). Это наблюдение представили Рон Киммель и Альфред Брукштейн. Несмотря на то, что работа Канни была выполнена на ранних этапах развития компьютерного зрения, детектор краев Канни (включая его вариации) до сих пор является передовым детектором краев. Детекторы краев, превосходящие Канни по производительности, обычно требуют большего времени вычислений или большего числа параметров.

Ковалевский

Владимир А. Ковалевский предложил существенно иной подход. Он использует предварительную обработку изображения фильтром Сигма и специальным фильтром для сглаживания градиентов. Этот метод не использует яркость изображения, а только интенсивности цветовых каналов, что важно для обнаружения границы между двумя соседними пикселями одинаковой яркости, но разных цветов. Метод сканирует изображение дважды: сначала по горизонтальным линиям, а затем по вертикальным столбцам. В каждой горизонтальной линии рассматриваются шесть последовательных соседних пикселей и вычисляется разность цветовых каналов между каждыми двумя соседними пикселями. Каждая цветовая разность представляет собой сумму абсолютных разностей интенсивностей цветовых каналов Красного, Зеленого и Синего соответствующих соседних пикселей. Если эта сумма превышает заданный порог, то знак разности цветов устанавливается равным знаку разности зеленых интенсивностей. Если разность зеленых интенсивностей равна нулю, то знак разности цветов устанавливается равным знаку разности красных интенсивностей. Если же и разность зеленых, и разность красных интенсивностей равны нулю, то знак разности цветов устанавливается равным знаку разности синих интенсивностей, которая в этом случае не может быть нулевой, поскольку сумма больше порога. Определенные условия для значений и знаков пяти цветовых разностей сформулированы таким образом, что при их выполнении между третьим и четвертым из шести пикселей помещается короткий вертикальный штрих, обозначающий границу. Аналогичные вычисления выполняются для вертикальных столбцов. В этом случае между третьим и четвертым из шести последовательных пикселей помещается короткий горизонтальный штрих. Вертикальные и горизонтальные штрихи (являясь одномерными ячейками абстрактного клеточного комплекса, соответствующего изображению) в основном формируют связанную последовательность, представляющую границу. Этот метод устойчив и очень быстр, и, что более важно, он способен обнаруживать границы между соседними пикселями одинаковой яркости, если разность цветов между этими пикселями превышает порог. Детектор Canny–Deriche был получен на основе схожих математических критериев с детектором краев Canny, однако с отправной точки дискретного представления и последующим построением набора рекурсивных фильтров для сглаживания изображения вместо экспоненциальных или гауссовских фильтров. Дифференциальный детектор краев, описанный ниже, можно рассматривать как переформулировку метода Канни с точки зрения дифференциальных инвариантов, вычисленных из представления в масштабно-пространственной области, что дает ряд преимуществ как с точки зрения теоретического анализа, так и субпиксельной реализации. В этом контексте фильтр Log Gabor показал себя как хороший выбор для выделения границ в естественных сценах.

Пороговые значения и связь

После того, как мы вычислили меру силы границы (обычно – величина градиента), следующим этапом является применение порога, чтобы определить, присутствуют ли границы в данной точке изображения. Чем ниже порог, тем больше границ будет обнаружено, и результат будет всё более подвержен шуму и обнаружению границ нерелевантных деталей изображения. И наоборот, высокий порог может пропустить слабые границы или привести к их фрагментации. Если порог применяется только к изображению величины градиента, полученные границы, как правило, будут толстыми, и потребуется постобработка для их утонения. Однако для границ, обнаруженных с помощью подавления не-максимумов, кривые границ по определению тонкие, и пиксели границы могут быть соединены в полигональные контуры с помощью процедуры связывания (отслеживания) границ. На дискретной сетке этап подавления не-максимумов может быть реализован путем оценки направления градиента с использованием производных первого порядка, затем округления направления градиента до кратных 45 градусов и, наконец, сравнения значений величины градиента в предполагаемом направлении градиента. Распространенным подходом к решению проблемы выбора подходящих пороговых значений является использование пороговой обработки с гистерезисом. Этот метод использует несколько порогов для поиска границ. Мы начинаем с верхнего порога, чтобы найти начало границы. Как только у нас есть начальная точка, мы прослеживаем путь границы через изображение пиксель за пикселем, отмечая границу, когда значение превышает нижний порог. Мы прекращаем отмечать границу только тогда, когда значение опускается ниже нижнего порога. Этот подход основан на предположении, что границы, как правило, представляют собой непрерывные кривые, и позволяет нам следовать за слабым участком границы, который мы уже видели, не отмечая каждый шумный пиксель в изображении как границу. Тем не менее, остаётся проблема выбора подходящих параметров пороговой обработки, и оптимальные пороговые значения могут варьироваться в зависимости от изображения.

Подходы второго порядка

Некоторые операторы обнаружения границ основаны на производных второго порядка от интенсивности. Это, по сути, фиксирует скорость изменения градиента интенсивности. Таким образом, в идеальном непрерывном случае обнаружение нулевых пересечений второй производной соответствует обнаружению локальных максимумов градиента. Ранний оператор Марра — Хилдрета основан на обнаружении нулевых пересечений оператора Лапласа, примененного к изображению, сглаженному с помощью фильтра Гаусса. Однако можно показать, что этот оператор также выдает ложные границы, соответствующие локальным минимумам модуля градиента. Кроме того, этот оператор обеспечивает плохую локализацию на изогнутых границах. Следовательно, в настоящее время этот оператор представляет в основном исторический интерес.

Основанный на фазовой конгруентности

Недавнее развитие методов обнаружения границ использует частотный подход для определения местоположения границ. Методы фазовой конгруэнтности (также известные как фазовая когерентность) стремятся найти в изображении точки, где все синусоиды в частотной области находятся в фазе. Эти точки обычно соответствуют воспринимаемой границе, независимо от того, представлена ли граница резким изменением интенсивности в пространственной области. Ключевым преимуществом этой техники является её сильная реакция на полосы Маха и избежание ложных срабатываний, часто возникающих вблизи границ, образованных острыми углами. Граница, образованная острым углом, – это разрыв первой производной профиля яркости.

Трансформация фазового растяжения (PST)

Трансформация фазового растяжения, или PST, – это вычислительный подход к обработке сигналов и изображений, вдохновлённый физикой. Одно из её применений – обнаружение и классификация признаков. PST возникла в ходе исследований дисперсивной трансформации Фурье с временным растяжением. PST преобразует изображение, имитируя распространение через дифракционную среду с заданными трёхмерными дисперсионными свойствами (показателем преломления). Операция опирается на симметрию профиля дисперсии и может быть понята в терминах дисперсионных собственных функций или мод растяжения. PST выполняет функциональность, аналогичную фазово-контрастной микроскопии, но для цифровых изображений. PST также применима к цифровым изображениям, временным сигналам и временным рядам данных.

Подпиксель

Для повышения точности обнаружения границ было предложено несколько подпиксельных методов, включая методы аппроксимации кривыми, основанные на моментах, реконструктивные и методы эффекта частичной площади. Эти методы обладают различными характеристиками. Методы аппроксимации кривыми вычислительно просты, но легко подвержены влиянию шума. Методы, основанные на моментах, используют интегральный подход для снижения влияния шума, но в некоторых случаях могут требовать больших вычислительных затрат. Реконструктивные методы используют горизонтальные или вертикальные градиенты для построения кривой и нахождения пика кривой, определяющего границу с подпиксельной точностью. Методы эффекта частичной площади основаны на гипотезе о том, что значение каждого пикселя зависит от площади по обе стороны границы внутри этого пикселя, что позволяет получать точную оценку для каждого пикселя границы. Определенные варианты метода, основанного на моментах, показали наибольшую точность при обнаружении изолированных границ. Отличается использованием оператора Лапласа Гаусса (LoG) для обнаружения границ в цифровых изображениях. В отличие от других методов обнаружения границ, подход LoG сочетает в себе гауссовское сглаживание с операциями вычисления второй производной, обеспечивая одновременное снижение шума и повышение четкости границ. Ключевым преимуществом этого метода является его способность обнаруживать границы в различных масштабах путем регулировки стандартного отклонения гауссовского ядра, что позволяет обнаруживать как мелкие детали, так и широкие переходы. Более того, метод использует обнаружение нулевых пересечений на отклике LoG для точного определения границ, обеспечивая устойчивость к шуму и сохраняя непрерывность границ. Этот подход особенно эффективен для обнаружения границ с четкими очертаниями в изображениях, минимизируя ложные срабатывания из-за шума, что делает его ценным инструментом в приложениях компьютерного зрения, где критически важна точная локализация границ.