Введение
Разделение цифрового изображения на сегменты
В цифровой обработке изображений и компьютерном зрении сегментация изображения – это процесс разделения цифрового изображения на несколько сегментов изображения, также известных как области изображения или объекты изображения (наборы пикселей). Цель сегментации – упростить и/или изменить представление изображения, сделав его более осмысленным и удобным для анализа. Сегментация изображений обычно используется для обнаружения объектов и границ (линий, кривых и т.п.) на изображениях. Более точно, сегментация изображения – это процесс присвоения метки каждому пикселю изображения таким образом, чтобы пиксели с одинаковой меткой обладали определенными характеристиками. Результатом сегментации изображения является набор сегментов, которые в совокупности покрывают все изображение, или набор контуров, выделенных из изображения (см. обнаружение границ). Пиксели внутри каждой области схожи по определенной характеристике или вычисляемому свойству, такому как цвет, интенсивность или текстура. Соседние области значительно различаются по этой же характеристике.
Пороговые значения
Самый простой метод сегментации изображений называется методом пороговой обработки. Этот метод основан на пороговом уровне (или пороговом значении) для преобразования изображения в оттенках серого в бинарное изображение. Ключевым моментом этого метода является выбор порогового значения (или значений, если выбрано несколько уровней). В промышленности используются несколько популярных методов, включая метод максимальной энтропии, выравнивание гистограммы, метод Оцу (максимальная дисперсия) и кластеризацию k-средних. В последнее время были разработаны методы пороговой обработки изображений компьютерной томографии (КТ). Основная идея заключается в том, что, в отличие от метода Оцу, пороги определяются на основе рентгеновских снимков, а не (реконструированного) изображения. Новые методы предлагают использование многомерных нечетких правил на основе нелинейных порогов. В этих работах решение о принадлежности каждого пикселя к сегменту основывается на многомерных правилах, полученных из нечеткой логики и эволюционных алгоритмов, учитывающих условия освещения изображения и область применения.
Движение и интерактивная сегментация
Сегментация на основе движения — это техника, использующая движение в изображении для выполнения сегментации. Идея проста: анализировать разницу между парой изображений. Если объект интереса движется, эта разница и будет соответствовать этому объекту. Развивая эту идею, Кенни и др. предложили интерактивную сегментацию. Они используют робота для прикосновения к объектам, чтобы создать сигнал движения, необходимый для сегментации на основе движения. Интерактивная сегментация следует концепции интерактивного восприятия, предложенной Довом Кацем и Оливером Броком. Другой метод, основанный на движении, — это сегментация на основе жесткого движения.
Another technique that is based on motion is rigid motion segmentation.
Методы, основанные на сжатии
Методы, основанные на сжатии, постулируют, что оптимальная сегментация – это та, которая минимизирует, по всем возможным сегментациям, длину кодирования данных. Связь между этими двумя понятиями заключается в том, что сегментация пытается найти закономерности в изображении, и любая регулярность в изображении может быть использована для его сжатия. Метод описывает каждый сегмент по его текстуре и форме границы. Каждый из этих компонентов моделируется функцией распределения вероятностей, и его длина кодирования вычисляется следующим образом:
Кодирование границы использует тот факт, что области на естественных изображениях, как правило, имеют гладкий контур. Этот априорный фактор используется кодированием Хаффмана для кодирования дифференциального кода цепи контуров изображения. Таким образом, чем более гладкой является граница, тем меньшую длину кодирования она достигает. Текстура кодируется с помощью сжатия с потерями аналогично принципу минимальной длины описания (MDL), но здесь длина данных при заданной модели приближается к числу образцов, умноженному на энтропию модели. Текстура в каждой области моделируется многомерным нормальным распределением, энтропия которого имеет аналитическое выражение. Интересным свойством этой модели является то, что оцениваемая энтропия ограничивает истинную энтропию данных сверху. Это связано с тем, что среди всех распределений с заданным средним и ковариацией, нормальное распределение обладает наибольшей энтропией. Таким образом, истинная длина кодирования не может превышать то, что алгоритм пытается минимизировать. Для любой заданной сегментации изображения эта схема определяет количество битов, необходимых для кодирования этого изображения на основе данной сегментации. Следовательно, среди всех возможных сегментаций изображения цель состоит в том, чтобы найти сегментацию, которая производит минимальную длину кодирования. Этого можно достичь с помощью простого агломеративного метода кластеризации. Искажение при сжатии с потерями определяет грубость сегментации, и ее оптимальное значение может различаться для каждого изображения. Этот параметр можно оценить эвристически на основе контраста текстур на изображении. Например, когда текстуры на изображении похожи, например, в изображениях с камуфляжем, требуется более высокая чувствительность и, следовательно, более низкое квантование.
Методы на основе гистограммы
Методы, основанные на гистограмме, очень эффективны по сравнению с другими методами сегментации изображений, поскольку обычно требуют лишь одного прохода по пикселям. В этой технике гистограмма вычисляется для всех пикселей изображения, а пики и впадины на гистограмме используются для определения кластеров на изображении. Одним из недостатков метода поиска по гистограмме является то, что может быть сложно идентифицировать значимые пики и впадины. Методы, основанные на гистограмме, также могут быть быстро адаптированы для применения к нескольким кадрам, сохраняя при этом эффективность однопроходной обработки. Гистограмма может быть построена различными способами при рассмотрении нескольких кадров. Тот же подход, который применяется к одному кадру, может быть использован и для нескольких, а после объединения результатов пики и впадины, которые ранее было трудно идентифицировать, становятся более различимыми. Гистограмма также может быть применена для каждого пикселя, где полученная информация используется для определения наиболее часто встречающегося цвета в данной позиции пикселя. Этот подход сегментирует изображение на основе движущихся объектов и статического окружения, что приводит к другому типу сегментации, полезному для отслеживания видео.
Обнаружение краев
Обнаружение границ — хорошо развитая область в обработке изображений. Границы регионов и края тесно связаны, поскольку на границах регионов часто наблюдается резкий скачок интенсивности. Методы обнаружения границ, таким образом, использовались в качестве основы для других методов сегментации. Границы, выявленные с помощью обнаружения границ, часто оказываются разомкнутыми. Однако для сегментации объекта на изображении необходимы замкнутые границы регионов. Желаемые границы — это границы между такими объектами или пространственными таксонами. Пространственные таксоны представляют собой информационные гранулы, состоящие из чёткой области пикселей, расположенных на уровнях абстракции в иерархической вложенной архитектуре сцены. Они аналогичны гештальт-психологическому понятию «фигура-фон», но расширены, чтобы включать передний план, группы объектов, объекты и заметные части объектов. Методы обнаружения границ могут применяться к области пространственного таксона так же, как и к силуэту. Этот метод особенно полезен, когда разомкнутая граница является частью иллюзорного контура.
since there is often a sharp adjustment in intensity at the region boundaries. Edge detection techniques have therefore been used as the base of another segmentation technique. The edges identified by edge detection are often disconnected. To segment an object from an image however, one needs closed region boundaries. The desired edges are the boundaries between such objects or spatial taxons. Spatial taxons are information granules, consisting of a crisp pixel region, stationed at abstraction levels within a hierarchical nested scene architecture. They are similar to the Gestalt psychological designation of figure ground, but are extended to include foreground, object groups, objects and salient object parts. Edge detection methods can be applied to the spatial taxon region, in the same manner they would be applied to a silhouette. This method is particularly useful when the disconnected edge is part of an illusory contour
Методы сегментации также могут применяться к границам, полученным с помощью детекторов границ. Линдеберг и Ли разработали интегрированный метод, который сегментирует границы на прямые и криволинейные сегменты для распознавания объектов на основе частей, используя критерий минимальной длины описания (MDL), оптимизированный методом разделения и слияния с использованием кандидатов в точки разрыва, полученных из дополнительных признаков пересечений, для определения более вероятных точек, в которых следует рассматривать разделение на различные сегменты.
Применение изолированного точечного обнаружения в рентгеновской обработке изображений
Обнаружение изолированных точек имеет важное применение в различных областях, включая обработку рентгеновских изображений. Например, исходное рентгеновское изображение лопасти турбины можно исследовать попиксельно для выявления пористости в правом верхнем квадранте лопасти. Результат применения отклика детектора границ к этому рентгеновскому изображению можно аппроксимировать. Это демонстрирует сегментацию изолированных точек на изображении с использованием однопиксельных зондов.
Метод двойного кластеризации
Этот метод представляет собой комбинацию трех характеристик изображения: разделение изображения на основе анализа гистограммы проверяется высокой компактностью кластеров (объектов) и высокими градиентами их границ. Для этого необходимо ввести два пространства: одно пространство – это одномерная гистограмма яркости H = H(B); второе пространство – это двойное трехмерное пространство самого исходного изображения B = B(x, y). Первое пространство позволяет измерить, насколько компактно распределена яркость изображения, вычислив минимальное количество кластеров kmin. Пороговая яркость T, соответствующая kmin, определяет бинарное (черно-белое) изображение – растровое изображение b = φ(x, y), где φ(x, y) = 0, если B(x, y) < T, и φ(x, y) = 1, если B(x, y) ≥ T. Растровое изображение b является объектом в двойном пространстве. На этом растровом изображении необходимо определить меру, отражающую, насколько компактно расположены черные (или белые) пиксели. Таким образом, цель состоит в том, чтобы найти объекты с четкими границами. Для всех T необходимо вычислить величину MDC = G/(k × L) (где k – разница в яркости между объектом и фоном, L – длина всех границ, а G – средний градиент на границах). Максимум MDC определяет сегментацию.
Методы, основанные на частных дифференциальных уравнениях
Используя метод, основанный на частном дифференциальном уравнении (PDE), и решая это уравнение с помощью численной схемы, можно выполнить сегментацию изображения. Пропагация кривой – популярная техника в этой области, находящая широкое применение в извлечении объектов, отслеживании объектов, стереореконструкции и других задачах. Основная идея заключается в эволюции начальной кривой к минимуму потенциала функционала стоимости, определение которого отражает решаемую задачу. Как и в большинстве обратных задач, минимизация функционала стоимости является нетривиальной и накладывает определенные ограничения на гладкость решения, которые в данном случае могут быть выражены в виде геометрических ограничений на эволюционирующую кривую.
Параметрические методы
Лагранжианские методы основаны на параметризации контура в соответствии с определенной стратегией дискретизации, а затем на эволюции каждого элемента под воздействием сил, заданных изображением и внутренними условиями. Такие методы отличаются высокой скоростью и эффективностью, однако оригинальная "чисто параметрическая" формулировка (предложенная Кассом, Виткиным и Терзопулосом в 1987 году и известная как "змеи") обычно подвергается критике из-за ограничений в выборе стратегии дискретизации, внутренних геометрических свойств кривой, возможности изменения топологии (разделения и слияния кривой), решения задач в пространствах более высокой размерности и т.д. В настоящее время разработаны эффективные "дискретизированные" формулировки, позволяющие преодолеть эти ограничения, сохраняя при этом высокую эффективность. В обоих случаях минимизация энергии обычно выполняется с помощью метода наискорейшего градиентного спуска, при котором производные вычисляются, например, с использованием метода конечных разностей.
Методы установления уровня
Метод уровня был первоначально предложен Dervieux и Thomasset в 1979 и 1981 годах для отслеживания движущихся интерфейсов, а затем повторно разработан Osher и Sethian в 1988 году. В конце 1990-х годов он получил широкое распространение в различных областях обработки изображений. Его можно эффективно использовать для решения задачи распространения кривых/поверхностей/и т.п. неявным образом. Основная идея заключается в представлении развивающегося контура с помощью знакопеременной функции, ноль которой соответствует самому контуру. Затем, исходя из уравнения движения контура, можно легко вывести аналогичный поток для неявной поверхности, применение которого к нулевому уровню отразит распространение контура. Метод уровня обладает многочисленными преимуществами: он неявный, не требует задания параметров, обеспечивает прямой способ оценки геометрических свойств развивающейся структуры, позволяет изменять топологию и является внутренним. Его можно использовать для определения оптимизационного фреймворка, как предложили Zhao, Merriman и Osher в 1996 году. Таким образом, это очень удобный фреймворк для решения множества задач компьютерного зрения и анализа медицинских изображений. Исследования различных структур данных для метода уровня привели к созданию высокоэффективных реализаций этого метода.
Методы быстрого движения
Метод быстрого марширования применялся в сегментации изображений, а эта модель была усовершенствована (позволяя как положительные, так и отрицательные скорости распространения) в подходе, известном как обобщенный метод быстрого марширования.
Методы разделения графов
Методы разделения графов — эффективные инструменты для сегментации изображений, поскольку они моделируют влияние окрестностей пикселей на заданный кластер пикселей или отдельный пиксель, основываясь на предположении об однородности изображений. В этих методах изображение представляется в виде взвешенного неориентированного графа. Обычно пиксель или группа пикселей соответствуют узлам, а веса ребер определяют степень (не)сходства между соседними пикселями. Затем граф (изображение) разделяется согласно критерию, разработанному для моделирования "хороших" кластеров. Каждый раздел узлов (пикселей), выдаваемый этими алгоритмами, рассматривается как сегмент объекта на изображении; см. категоризацию объектов на основе сегментации. К популярным алгоритмам этой категории относятся нормализованные разрезы, алгоритм случайного блуждания, минимальный разрез, изопериметрическое разделение, сегментация на основе минимального остовного дерева и категоризация объектов на основе сегментации.
Случайные поля Маркова
Применение случайных полей Маркова (MRF) к изображениям было предложено в начале 1984 года Геманом и Геманом. Их прочная математическая база и способность обеспечивать глобальный оптимум, даже при определении на основе локальных признаков, стали основой для новых исследований в области анализа изображений, подавления шумов и сегментации. MRF полностью характеризуются априорными распределениями вероятностей, распределениями предельных вероятностей, кликами, сглаживающим ограничением, а также критерием обновления значений. Критерий сегментации изображений с использованием MRF формулируется как поиск схемы маркировки, имеющей максимальную вероятность для заданного набора признаков. Основные категории сегментации изображений с использованием MRF – это контролируемая и неконтролируемая сегментация.
Алгоритмы оптимизации
Каждый алгоритм оптимизации представляет собой адаптацию моделей из различных областей и выделяется своей уникальной функцией стоимости. Общей чертой функций стоимости является штраф за изменение значения пикселя, а также за разницу в метках пикселей по сравнению с метками соседних пикселей.
Симулированное отжигание (SA)
Полученный как аналог отжига в металлургии, моделируемый отжиг (SA) использует изменение меток пикселей в ходе итераций и оценивает разницу в энергии каждого вновь образованного графа по отношению к исходным данным. Если вновь образованный граф энергетически более выгоден, то есть имеет меньшую стоимость энергии, определяемую как:
алгоритм выбирает этот граф. Моделируемый отжиг требует задания температурных графиков, которые напрямую влияют на скорость сходимости системы, а также энергетического порога, необходимого для осуществления минимизации.
Альтернативные алгоритмы
Существует ряд других методов решения простых, а также MRF более высокого порядка. К ним относятся максимизация апостериорных маржинальных вероятностей, многомасштабная оценка MAP, сегментация с использованием нескольких разрешений и другие. Помимо оценок правдоподобия, для решения MRF существуют методы на основе разреза графа с использованием максимального потока и другие сильно ограниченные графовые методы.
Сегментация изображения с использованием MRF и максимизация ожиданий
Алгоритм ожиданий-максимизации используется для итеративной оценки апостериорных вероятностей и распределений меток в случае отсутствия обучающих данных и невозможности формирования оценки модели сегментации. Общий подход заключается в использовании гистограмм для представления признаков изображения и выполнении процедуры, кратко описанной в этом трехэтапном алгоритме:
1. Используется случайная оценка параметров модели. 2. Этап E: Оцениваются статистики классов на основе определенной случайной модели сегментации. На их основе вычисляется условная вероятность принадлежности к метке, учитывая набор признаков, с использованием теоремы наивного Байеса. Здесь – множество всех возможных меток. 3. Этап M: Установленная релевантность данного набора признаков схеме меток теперь используется для вычисления априорной оценки данной метки во второй части алгоритма. Поскольку фактическое количество меток неизвестно (по обучающим данным), в вычислениях используется скрытая оценка количества меток, заданная пользователем. где – множество всех возможных признаков.
Недостатки сегментации изображений на основе MAP и EM
Точные оценки MAP сложно вычислить. Приблизительные оценки MAP требуют больших вычислительных затрат. Расширение на многоклассовую разметку снижает производительность и увеличивает объём необходимой памяти. Для достижения глобального оптимума требуется надёжная оценка параметров для EM-алгоритма. В зависимости от метода оптимизации, сегментация может сходиться к локальным минимумам.
Трансформация водосборного бассейна
Трансформация водораздела рассматривает величину градиента изображения как топографическую поверхность. Пиксели с наибольшей интенсивностью градиента (GMI) соответствуют линиям водораздела, которые представляют собой границы областей. Вода, помещенная на любой пиксель, заключенный общей линией водораздела, стекает вниз к общему локальному минимуму интенсивности (LIM). Пиксели, дренирующиеся к общему минимуму, формируют водосборный бассейн, который представляет собой сегмент.
Сегментация на основе модели
Центральное предположение подходов, основанных на моделях, заключается в том, что интересующие нас структуры имеют тенденцию к определенной форме. Следовательно, можно искать вероятностную модель, которая описывает эту форму и ее вариативность. При сегментации изображения можно наложить ограничения, используя эту модель в качестве априорной информации. Такая задача может включать в себя: (i) приведение обучающих примеров к общей позе, (ii) вероятностное представление вариаций приведенных примеров и (iii) статистический вывод о соответствии модели и изображения. Другие важные методы сегментации на основе моделей, описанные в литературе, включают активные модели формы и активные модели внешнего вида.
Сегментация в нескольких масштабах
Сегментация изображений вычисляется на различных масштабах в пространстве масштабов и иногда распространяется от крупных к мелким масштабам; см. сегментацию в пространстве масштабов. Критерии сегментации могут быть сколь угодно сложными и учитывать как глобальные, так и локальные признаки. Распространенным требованием является связность каждого региона в том или ином смысле.
Одномерная иерархическая сегментация сигнала
Основная работа Виткина в области масштабного пространства включала в себя представление о том, что одномерный сигнал можно однозначно сегментировать на области, при этом один параметр масштаба управляет масштабом сегментации. Ключевым наблюдением является то, что нулевые переходы вторых производных (минимумы и максимумы первой производной, или наклона) многомасштабно сглаженных версий сигнала формируют гнездовую структуру, определяющую иерархические связи между сегментами в различных масштабах. В частности, экстремумы наклона в грубых масштабах можно проследить до соответствующих признаков в мелких масштабах. Когда максимум и минимум наклона взаимно уничтожаются на большем масштабе, три сегмента, которые они разделяли, объединяются в один, тем самым определяя иерархию сегментов.
Сегментация изображения и первичный эскиз
В этой области было проведено множество исследований, из которых некоторые достигли стадии, позволяющей их применение либо с интерактивным ручным вмешательством (обычно в медицинской визуализации), либо в полностью автоматическом режиме. Ниже представлен краткий обзор основных исследовательских идей, лежащих в основе современных подходов. Однако структура вложенности, описанная Уиткином, специфична для одномерных сигналов и нетривиально переносится на многомерные изображения. Тем не менее, эта общая идея вдохновила ряд других авторов на изучение схем сегментации изображений от грубого к детальному. Коендеринк предложил изучить эволюцию контуров изоинтенсивности в различных масштабах, и этот подход был более детально исследован Лифшицем и Пизером. К сожалению, интенсивность признаков изображения меняется в зависимости от масштаба, что затрудняет отслеживание признаков изображения крупного масштаба до более мелких, используя информацию об изоинтенсивности. Линдеберг исследовал проблему связывания локальных экстремумов и седловых точек в различных масштабах и предложил представление изображения, называемое первичным эскизом масштабного пространства, которое явно отображает отношения между структурами в разных масштабах, а также выделяет стабильные признаки изображения в широком диапазоне масштабов, включая локально подходящие масштабы. Бергхольм предложил обнаруживать края в крупном масштабе в масштабном пространстве, а затем отслеживать их до более мелкого масштаба с ручным выбором как масштаба грубого обнаружения, так и масштаба точной локализации. Гауч и Пизер изучили взаимодополняющую проблему гребней и долин в нескольких масштабах и разработали инструмент для интерактивной сегментации изображений на основе многомасштабных водоразделов. Использование многомасштабных водоразделов применительно к градиентной карте также было исследовано Ольсеном и Нильсеном и внедрено в клиническую практику Дамом. Винкен и соавторы предложили гиперстек для определения вероятностных связей между структурами изображения в разных масштабах. Ахуджа и его коллеги развили идею использования стабильных структур изображения в масштабах, создав полностью автоматизированную систему. Ундеман и Линдеберг представили полностью автоматический алгоритм сегментации мозга, основанный на тесно связанных идеях многомасштабных водоразделов, и провели его обширное тестирование на базах данных мозга. Флорак и Куйпер также использовали эти идеи многомасштабной сегментации изображений путем связывания структур изображения в различных масштабах. Бижауи и Руэ объединяют структуры, обнаруженные в масштабном пространстве выше минимального порога шума, в объектное дерево, охватывающее несколько масштабов и соответствующее определенному признаку в исходном сигнале. Извлеченные признаки точно реконструируются с использованием итеративного метода сопряженных градиентов.
Полуавтоматическая сегментация
В одном из видов сегментации пользователь выделяет интересующую область щелчками мыши, после чего применяются алгоритмы для определения пути, наилучшим образом соответствующего границе изображения. В этом виде сегментации используются такие методы, как SIOX, Livewire, Intelligent Scissors или IT SNAPS. В альтернативном виде полуавтоматической сегментации алгоритмы возвращают пространственный таксон (то есть передний план, группу объектов, объект или часть объекта), выбранный пользователем или определённый на основе априорных вероятностей.
Обучаемая сегментация
Большинство вышеупомянутых методов сегментации основаны исключительно на цветовой информации пикселей изображения. Люди используют гораздо больше знаний при выполнении сегментации изображений, однако реализация этих знаний потребует значительных затрат на разработку и вычислительное время, а также огромной базы данных знаний предметной области, которой в настоящее время не существует. Обучаемые методы сегментации, такие как сегментация с использованием нейронных сетей, решают эти проблемы, моделируя знания предметной области на основе набора данных размеченных пикселей. Нейронная сеть для сегментации изображений может обрабатывать небольшие области изображения для извлечения простых признаков, таких как границы. Другая нейронная сеть или любой механизм принятия решений может затем объединить эти признаки для соответствующей маркировки областей изображения. Сеть, разработанная таким образом, называется картой Кохонена. Импульсно-связанные нейронные сети (PCNN) – это нейронные модели, предложенные на основе моделирования зрительной коры кошки и разработанные для высокопроизводительной биомиметической обработки изображений. В 1989 году Рейнхард Экхорн представил нейронную модель, имитирующую механизм зрительной коры кошки. Модель Экхорна предоставила простой и эффективный инструмент для изучения зрительной коры мелких млекопитающих и вскоре была признана имеющей значительный потенциал применения в обработке изображений. В 1994 году модель Экхорна была адаптирована в алгоритм обработки изображений Джоном Л. Джонсоном, который назвал этот алгоритм импульсно-связанной нейронной сетью. За последнее десятилетие PCNN использовались для широкого спектра приложений обработки изображений, включая сегментацию изображений, генерацию признаков, извлечение лиц, обнаружение движения, расширение области, подавление шума и так далее. PCNN представляет собой двухмерную нейронную сеть. Каждый нейрон в сети соответствует одному пикселю во входном изображении, получая цветовую информацию соответствующего пикселя (например, интенсивность) в качестве внешнего стимула. Каждый нейрон также связан со своими соседними нейронами, получая от них локальные стимулы. Внешние и локальные стимулы объединяются во внутренней системе активации, которая накапливает стимулы до тех пор, пока не будет превышен динамический порог, что приводит к импульсному выходу. В результате итеративных вычислений нейроны PCNN генерируют временные ряды импульсных выходов. Временные ряды импульсных выходов содержат информацию о входных изображениях и могут использоваться для различных приложений обработки изображений, таких как сегментация изображений и генерация признаков. По сравнению с традиционными методами обработки изображений, PCNN обладают рядом значительных преимуществ, включая устойчивость к шуму, независимость от геометрических изменений входных шаблонов, способность преодолевать незначительные изменения интенсивности во входных шаблонах и т.д. U-Net – это сверточная нейронная сеть, которая принимает на вход изображение и выдает метку для каждого пикселя. U-Net изначально была разработана для обнаружения границ клеток на биомедицинских изображениях. U-Net следует классической архитектуре автокодировщика и, следовательно, содержит две подструктуры. Структура кодировщика следует традиционному стеку сверточных и слоев максимального объединения для увеличения рецептивного поля по мере прохождения через слои. Она используется для захвата контекста в изображении. Структура декодировщика использует транспонированные сверточные слои для повышения дискретизации, чтобы конечные размеры были близки к размерам входного изображения. Промежуточные соединения (skip connections) размещаются между сверточными и транспонированными сверточными слоями одинаковой формы для сохранения деталей, которые в противном случае были бы потеряны. Помимо задач семантической сегментации на уровне пикселей, которые присваивают каждой точке определенную категорию, современные приложения сегментации включают задачи семантической сегментации на уровне экземпляров, в которых каждый отдельный объект в данной категории должен быть однозначно идентифицирован, а также задачи паноптической сегментации, которые объединяют эти две задачи для обеспечения более полной сегментации сцены. Задача одновременной сегментации сцен из связанных изображений или видеокадров называется ко-сегментацией.