Автоматическая аннотация изображений: методы и преимущества
Automatic image annotation
Автоматическая аннотация изображений: компьютерное зрение, ключевые слова, классификация, поиск по картинкам. Обучение моделей машинного обучения для анализа фото.
Сравнивайте с английским: нажмите на абзац — оригинал откроется в окне. Кнопка EN под абзацем показывает его прямо в тексте.
Введение
Автоматическая аннотация изображений (также известная как автоматическая разметка изображений или лингвистическая индексация) — это процесс, посредством которого компьютерная система автоматически присваивает метаданные в виде подписей или ключевых слов цифровому изображению. Это применение методов компьютерного зрения используется в системах поиска изображений для организации и обнаружения интересующих изображений в базе данных. Этот метод можно рассматривать как разновидность многоклассовой классификации изображений с очень большим числом классов, сопоставимым с размером словаря. Как правило, анализ изображений в форме извлеченных векторов признаков и обучающих аннотаций используется в методах машинного обучения для автоматического применения аннотаций к новым изображениям. Первые методы изучали корреляции между признаками изображения и обучающими аннотациями, затем были разработаны методы с использованием машинного перевода для попытки перевода текстового словаря в "визуальный словарь" или кластерные области, известные как блобы. Последующие работы включали подходы к классификации, модели релевантности и так далее. Преимущества автоматической аннотации изображений по сравнению с поиском изображений на основе содержания (CBIR) заключаются в том, что пользователи могут формулировать запросы более естественным образом. CBIR обычно (на данный момент) требует от пользователей поиска по концепциям изображения, таким как цвет и текстура, или по поиску примеров. Определенные признаки в примерах изображений могут затмевать концепцию, на которой пользователь действительно фокусируется. Традиционные методы поиска изображений, используемые, например, в библиотеках, опирались на изображения, аннотированные вручную, что является дорогостоящим и трудоемким, особенно учитывая большие и постоянно растущие базы данных изображений.
Automatic image annotation (also known as automatic image tagging or linguistic indexing) is the process by which a computer system automatically assigns metadata in the form of captioning or keywords to a digital image. This application of computer vision techniques is used in image retrieval systems to organize and locate images of interest from a database. This method can be regarded as a type of multi class image classification with a very large number of classes as large as the vocabulary size. Typically, image analysis in the form of extracted feature vectors and the training annotation words are used by machine learning techniques to attempt to automatically apply annotations to new images. The first methods learned the correlations between image features and training annotations, then techniques were developed using machine translation to try to translate the textual vocabulary with the 'visual vocabulary', or clustered regions known as blobs. Work following these efforts have included classification approaches, relevance models and so on. The advantages of automatic image annotation versus content based image retrieval (CBIR) are that queries can be more naturally specified by the user. CBIR generally (at present) requires users to search by image concepts such as color and texture, or finding example queries. Certain image features in example images may override the concept that the user is really focusing on. The traditional methods of image retrieval such as those used by libraries have relied on manually annotated images, which is expensive and time consuming, especially given the large and constantly growing image databases in existence.