Введение
Положение и ориентация объекта в изображении
В областях вычислительной техники и компьютерного зрения поза (или пространственная поза) представляет собой положение и ориентацию объекта, как правило, в трех измерениях. Позы часто хранятся внутри в виде матриц преобразований. Термин "поза" в значительной степени является синонимом термина "преобразование", однако преобразование часто может включать масштаб, в то время как поза – нет. В компьютерном зрении поза объекта часто оценивается на основе данных с камеры посредством процесса оценки позы. Эта информация может быть использована, например, для того, чтобы робот мог манипулировать объектом или избегать столкновения с ним, основываясь на его воспринимаемом положении и ориентации в окружающей среде. Другие области применения включают распознавание скелетных движений.
In the fields of computing and computer vision, pose (or spatial pose) represents the position and orientation of an object, usually in three dimensions. Poses are often stored internally as transformation matrices. The term “pose” is largely synonymous with the term “transform”, but a transform may often include scale, whereas pose does not. In computer vision, the pose of an object is often estimated from camera input by the process of pose estimation. This information can then be used, for example, to allow a robot to manipulate an object or to avoid moving into the object based on its perceived position and orientation in the environment. Other applications include skeletal action recognition.
Оценка позы
Специфическая задача определения позы объекта на изображении (или стереоизображениях, последовательности изображений) называется оценкой позы. Задачи оценки позы могут решаться различными способами в зависимости от конфигурации датчика изображения и выбранной методологии. Можно выделить три класса методологий:
Аналитические или геометрические методы: при условии, что датчик изображения (камера) откалиброван и известно отображение из 3D точек в сцене в 2D точки на изображении. Если также известна геометрия объекта, это означает, что проецируемое изображение объекта на изображении камеры является хорошо известной функцией его позы. После идентификации на объекте набора контрольных точек, как правило, углов или других характерных точек, можно решить задачу определения преобразования позы из набора уравнений, связывающих 3D-координаты точек с их 2D-координатами на изображении. Алгоритмы, определяющие положение облака точек относительно другого облака точек, известны как алгоритмы регистрации множеств точек, если соответствия между точками заранее неизвестны. Методы генетических алгоритмов: если вычисление позы объекта не требуется в реальном времени, можно использовать генетический алгоритм. Этот подход особенно устойчив при неидеальной калибровке изображений. В этом случае поза представляет собой генетическое представление, а ошибка между проекцией контрольных точек объекта и изображением – функцию пригодности. Методы, основанные на обучении: эти методы используют систему искусственного обучения, которая выучивает отображение из 2D признаков изображения в преобразование позы. Иными словами, системе необходимо предоставить достаточно большой набор изображений объекта в различных позах во время фазы обучения. После завершения фазы обучения система должна быть способна оценить позу объекта по его изображению.