Введение

Автоматическая аннотация изображений (также известная как автоматическая разметка изображений или лингвистическая индексация) — это процесс, посредством которого компьютерная система автоматически присваивает метаданные в виде подписей или ключевых слов цифровому изображению. Это применение методов компьютерного зрения используется в системах поиска изображений для организации и обнаружения интересующих изображений в базе данных. Этот метод можно рассматривать как разновидность многоклассовой классификации изображений с очень большим числом классов, сопоставимым с размером словаря. Как правило, анализ изображений в форме извлеченных векторов признаков и обучающих аннотаций используется в методах машинного обучения для автоматического применения аннотаций к новым изображениям. Первые методы изучали корреляции между признаками изображения и обучающими аннотациями, затем были разработаны методы с использованием машинного перевода для попытки перевода текстового словаря в "визуальный словарь" или кластерные области, известные как блобы. Последующие работы включали подходы к классификации, модели релевантности и так далее. Преимущества автоматической аннотации изображений по сравнению с поиском изображений на основе содержания (CBIR) заключаются в том, что пользователи могут формулировать запросы более естественным образом. CBIR обычно (на данный момент) требует от пользователей поиска по концепциям изображения, таким как цвет и текстура, или по поиску примеров. Определенные признаки в примерах изображений могут затмевать концепцию, на которой пользователь действительно фокусируется. Традиционные методы поиска изображений, используемые, например, в библиотеках, опирались на изображения, аннотированные вручную, что является дорогостоящим и трудоемким, особенно учитывая большие и постоянно растущие базы данных изображений.